Docs  /  Neural Learning Methods (full brainstorm implementation)

Neural Learning Methods (full brainstorm implementation)

Completes the learning-methods brainstorm on top of MathNNLearning (L0–L5) and RLAgentNet.

Stack

Layer Role
_MathNNLearning prefer, imitate, distill, transfer, curriculum, federate, promote, …
_NeuralLearnMethods Dyna, offline RL, PER, n-step, DAgger, EWC-lite, SSL mask, RLAIF, nightly, learn_* packs
_MathNNExperience transitions, demos, prefer pairs, prioritized sample, recent n-step
_RLAgentNet Observe + PredictDynamics + ObserveSynthetic (imagined/offline)

Commands

nn learn method status [agent]
nn learn method dyna on 8 0.35
nn learn method dyna run minecraft 8
nn learn method offline minecraft 128 per
nn learn method per minecraft on 0.6
nn learn method nstep minecraft 3 0.95
nn learn method dagger on 0.15
nn learn method dagger capture minecraft 5
nn learn method ewc on 100
nn learn method ewc snapshot minecraft
nn learn method ssl minecraft 64
nn learn method multiobj 1.0 0.25 0.2
nn learn method rlaif good
nn learn method nightly minecraft 256
nn learn method pack learn_all

Also: nn learn dyna …, nn learn offline … (shortcuts), and
nn learn pack learn_bc|learn_offline|learn_pref|learn_dyna|learn_curriculum|learn_federate|learn_nightly|learn_safe|learn_all.

Method map (brainstorm → code)

Brainstorm Implementation
Supervised / BC imitate, SupervisedQStep, dagger capture
Preference / RM prefer, rlaif, multiobj prefer weight
Self-supervised ssl mask reconstruction via WM
Online RL domain train + Observe
Model-based Dyna dyna on + OnRealTransition imagination + PredictDynamics
Offline RL offline replay from experience
PER SamplePrioritized / per on
n-step nstep blends recent returns in offline
DAgger dagger on uncertainty + dagger capture human action
EWC-lite ewc snapshot + pull Q toward anchor
Curriculum existing curriculum + pack learn_curriculum
Distill / transfer / federate / promote existing MathNNLearning
Nightly nightly = offline + ssl + prefer train + dyna + promote
Safe align learn_safe + align ethics + safe MO weight
Multi-objective multiobj env prefer safe
World model curiosity curious + WM enable
Learning packs learn_* packs above

Learn packs

Pack Effect
learn_bc imitate_protect + dagger + imitate start
learn_offline PER + n-step 3 + offline train 256
learn_pref RM + teach_live + prefer weight
learn_dyna Dyna k=8 + wm_dyna pack
learn_curriculum curriculum easy + scout pack
learn_federate federate push
learn_nightly full nightly drain
learn_safe ethics align + safe MO
learn_all dyna+per+nstep+dagger+ewc+ssl+safe MO

Minecraft example

minecraft dqn pack apply net_curiosity
nn learn method pack learn_all
nn learn method dyna on 8
minecraft dqn train
# human feedback:
minecraft dqn reward 0.4
nn learn method rlaif good
# after session:
nn learn method nightly minecraft 256
nn learn promote minecraft multi

Files

  • NeuralLearnMethods.hpp / .cpp
  • Hooks in RLAgentNet::Observe / Select
  • Experience: SamplePrioritized, RecentTransitions
  • RLAgentNet::PredictDynamics, ObserveSynthetic
Generated from the project markdown docs on 2026-07-24. This is a static, self-contained site.