MathNN Learning Functions (full stack)
Implementation of the learning-functions brainstorm (L0–L5).
Architecture
[text]
nn learn <verb>
→ _MathNNLearning
├─ _MathNNExperience (transitions, demos, prefer pairs, jobs)
├─ _RLAgentNet (Q/RM/WM, Select/Observe, SupervisedQStep)
├─ _MathNNDevice (train/infer placement)
└─ _RLCheckpointMySQL (meta, transfer, quant, federate, promote)
Experience store
| Buffer | Filled by |
| Transitions | Every RLAgentNet::Observe |
| Last state/action | Select + Observe |
| Demos | imitate start + Select, or load file |
| Prefer pairs | prefer good/bad and prefer pair |
| Jobs | nn learn jobs enqueue … |
Verbs (implemented)
| Verb | Real behavior |
| prefer | RM feedback on last state; auto pair buffer |
| prefer pair / train | Explicit pairs + batch RM train |
| curious | WM on + scale; warm on stored transitions |
| imitate start/stop/train | Demo record + BC via SupervisedQStep |
| distill | Weight copy + KD matching teacher Q |
| transfer | Full load; optional encoder fine-tune |
| adapt | RM plasticity + replay mix |
| quantize | Save + cal pass + NPU placement + JSON sidecar |
| shadow | Peer agent + dual-Q metrics on Select |
| curriculum | Phases + success-gated next |
| hierarchy | Options + HierarchyAct worker steps |
| whatif | Q on last state + WM-style horizon |
| align | RM + low curiosity + batch caution labels |
| federate | push/pull MySQL + avg ≈ KD toward global |
| promote | multi-metric gate (loss, pref, shadow) |
| scale | tiny/default/large/huge + device pref |
| pack | TutorOS, EmbodiedCraft, LifeCoach, Operator, MetaMind, WorldForge |
| jobs | enqueue / drain simple train jobs |
| experience | Store stats |
Examples
[text]
nn learn imitate start life
# … agent acts …
nn learn imitate stop life
nn learn imitate train life 128
nn learn prefer good
nn learn prefer train life 32
nn learn distill life from life_focus_blocks 64
nn learn transfer minecraft space_engineers encoder
nn learn shadow minecraft on
nn learn promote minecraft multi
nn learn pack EmbodiedCraft
nn learn pack LifeCoach
nn learn whatif 0 3
nn learn federate life push
nn learn federate life avg
Files
- MathNNExperience.hpp/cpp
- MathNNLearning.hpp/cpp
- hooks in RLAgentNet.cpp (Observe → store, Select → demo/shadow)
Still future (honest)
- True ONNX NPU EP execution
- Cryptographic FedAvg / secure aggregation
- Full DAgger loop UI
- External async trainer process
Filed under: Uncategorized - @ July 18, 2026 6:42 am