Docs / Neural Learning Methods (full brainstorm implementation)
Neural Learning Methods (full brainstorm implementation)
Completes the learning-methods brainstorm on top of MathNNLearning (L0–L5) and RLAgentNet.
Stack
| Layer | Role |
|---|---|
_MathNNLearning |
prefer, imitate, distill, transfer, curriculum, federate, promote, … |
_NeuralLearnMethods |
Dyna, offline RL, PER, n-step, DAgger, EWC-lite, SSL mask, RLAIF, nightly, learn_* packs |
_MathNNExperience |
transitions, demos, prefer pairs, prioritized sample, recent n-step |
_RLAgentNet |
Observe + PredictDynamics + ObserveSynthetic (imagined/offline) |
Commands
nn learn method status [agent]
nn learn method dyna on 8 0.35
nn learn method dyna run minecraft 8
nn learn method offline minecraft 128 per
nn learn method per minecraft on 0.6
nn learn method nstep minecraft 3 0.95
nn learn method dagger on 0.15
nn learn method dagger capture minecraft 5
nn learn method ewc on 100
nn learn method ewc snapshot minecraft
nn learn method ssl minecraft 64
nn learn method multiobj 1.0 0.25 0.2
nn learn method rlaif good
nn learn method nightly minecraft 256
nn learn method pack learn_all
Also: nn learn dyna …, nn learn offline … (shortcuts), and
nn learn pack learn_bc|learn_offline|learn_pref|learn_dyna|learn_curriculum|learn_federate|learn_nightly|learn_safe|learn_all.
Method map (brainstorm → code)
| Brainstorm | Implementation |
|---|---|
| Supervised / BC | imitate, SupervisedQStep, dagger capture |
| Preference / RM | prefer, rlaif, multiobj prefer weight |
| Self-supervised | ssl mask reconstruction via WM |
| Online RL | domain train + Observe |
| Model-based Dyna | dyna on + OnRealTransition imagination + PredictDynamics |
| Offline RL | offline replay from experience |
| PER | SamplePrioritized / per on |
| n-step | nstep blends recent returns in offline |
| DAgger | dagger on uncertainty + dagger capture human action |
| EWC-lite | ewc snapshot + pull Q toward anchor |
| Curriculum | existing curriculum + pack learn_curriculum |
| Distill / transfer / federate / promote | existing MathNNLearning |
| Nightly | nightly = offline + ssl + prefer train + dyna + promote |
| Safe align | learn_safe + align ethics + safe MO weight |
| Multi-objective | multiobj env prefer safe |
| World model curiosity | curious + WM enable |
| Learning packs | learn_* packs above |
Learn packs
| Pack | Effect |
|---|---|
learn_bc |
imitate_protect + dagger + imitate start |
learn_offline |
PER + n-step 3 + offline train 256 |
learn_pref |
RM + teach_live + prefer weight |
learn_dyna |
Dyna k=8 + wm_dyna pack |
learn_curriculum |
curriculum easy + scout pack |
learn_federate |
federate push |
learn_nightly |
full nightly drain |
learn_safe |
ethics align + safe MO |
learn_all |
dyna+per+nstep+dagger+ewc+ssl+safe MO |
Minecraft example
minecraft dqn pack apply net_curiosity
nn learn method pack learn_all
nn learn method dyna on 8
minecraft dqn train
# human feedback:
minecraft dqn reward 0.4
nn learn method rlaif good
# after session:
nn learn method nightly minecraft 256
nn learn promote minecraft multi
Files
NeuralLearnMethods.hpp/.cpp- Hooks in
RLAgentNet::Observe/Select - Experience:
SamplePrioritized,RecentTransitions RLAgentNet::PredictDynamics,ObserveSynthetic
Generated from the project markdown docs on 2026-07-24. This is a static, self-contained site.