Knowledge RL
Knowledge RL is the claim-acquisition and epistemic-labeling subsystem. It keeps claims, labels, source trust, conflicts, confidence, and Q-table state for deciding which claim should be presented or trained next.
Main Concepts
- Claim: a text statement stored with source, priority, confidence, and trust.
- Label:
true,false,depends,unknown, orunlabeled. - Conflict: a relationship between claims that should be reviewed.
- Source trust: a
0.0to1.0value used in confidence and prioritization. - RL state: presentation counts, label history, episode reward, and Q-table entries used by training mode.
Modes
off
acquire
train
eval
Common mode commands:
knowledge on
knowledge off
knowledge status
knowledge rl train
knowledge rl observe
knowledge rl step
knowledge rl train replay 5
knowledge rl eval
knowledge rl off
knowledge rl status
Claim Workflow
knowledge claim <statement>
knowledge next
knowledge true
knowledge false
knowledge depends
knowledge unknown
knowledge label true <claim text>
knowledge label false <claim text>
knowledge label depends <claim text>
knowledge label unknown <claim text>
knowledge next presents the next claim selected by the current policy. Direct
label commands without claim text apply to the current claim.
Stats And Exports
knowledge stats
knowledge rl stats
knowledge rl replay [limit]
knowledge rl explain
knowledge rl benchmark [episodes]
knowledge graphs
knowledge graphs to <directory>
knowledge rl graphs
knowledge rl graphs to <directory>
Graph export writes:
knowledge_rl_stats.json
knowledge_rl_stats.md
knowledge_rl_stats.csv
knowledge_rl_label_distribution.svg
knowledge_rl_confidence_histogram.svg
knowledge_rl_source_trust.svg
knowledge_rl_reward_timeline.svg
Conflicts And Trust
knowledge conflicts
knowledge trust <source_or_claim> <0.0-1.0>
Use trust updates when one source is consistently reliable or unreliable. Do not use trust as proof by itself; it is a prioritization signal.
Checkpoints
Default files are under D:/knowledge_rl_logs unless settings override it:
claims.json
knowledge_rl_checkpoint.txt
label_transitions.csv
Commands:
knowledge save
knowledge load
knowledge save mysql
knowledge load mysql
knowledge checkpoint mysql on
knowledge checkpoint mysql off
knowledge checkpoint mysql profile <profile>
knowledge checkpoint profile <profile>
MySQL checkpoints use the ai_settings database and the configured MySQL
profile.
Lua Globals
Agents can call:
knowledge_rl_status()
knowledge_rl_stats()
knowledge_rl_stats_json()
knowledge_rl_export_graphs(path)
knowledge_rl_set_mode(mode)
knowledge_rl_get_mode()
knowledge_rl_add_claim(text)
knowledge_rl_label_claim(text, label)
knowledge_rl_label_current(label)
knowledge_rl_next_claim()
knowledge_rl_save()
knowledge_rl_load()
knowledge_rl_save_mysql()
knowledge_rl_load_mysql()
knowledge_rl_conflicts()
knowledge_rl_set_trust(source_or_claim, score)
knowledge_rl_observe()
knowledge_rl_step()
knowledge_rl_train_replay(episodes)
knowledge_rl_eval()
knowledge_rl_replay(limit)
knowledge_rl_benchmark(episodes)
knowledge_rl_explain()
knowledge_rl_use()
Recommended Use
During Training
Use Knowledge RL while building the knowledge base:
knowledge on
knowledge claim <source-backed statement>
knowledge rl observe
knowledge rl step
knowledge true|false|depends|unknown
knowledge rl train replay 5
knowledge rl eval
knowledge conflicts
knowledge rl stats
knowledge rl graphs
knowledge save
What each command does during training:
knowledge rl observeemits the current Knowledge RL state as JSON: claims, labels, confidence, trust, conflicts, Q-table stats, current claim, available actions, and recommended next action.knowledge rl stepruns one policy step. It reviews conflicts first, presents unlabeled/high-priority claims next, or replays training if everything is labeled.knowledge true|false|depends|unknownsupplies the reward signal by labeling the current claim.knowledge rl train replay [episodes]replays already-labeled claims into the Q-table. It does not invent labels.knowledge rl evalreports readiness for answer review and memory consolidation.knowledge conflictsshould be clean before using the knowledge base as strong evidence.
After Training
Use Knowledge RL after training as a quality layer:
knowledge rl eval
knowledge conflicts
knowledge rl explain
knowledge rl stats
knowledge rl graphs
knowledge save mysql
Post-training uses:
- answer review: detect unsupported, uncertain, or contradicted claims before final answers
- source triage: prefer high-trust sources and flag low-trust or high-conflict sources
- memory consolidation: store high-confidence claims and avoid saving weak claims
- research routing: decide whether to search local docs, MySQL memory, web/research agents, or specialist agents
- citation gap detection: identify claims that need stronger evidence
- agent control: expose
knowledge_rl_observationto simple agents, researcher agents, and domain agents
Operational Commands
knowledge rl observe
knowledge rl step
knowledge rl train replay [episodes]
knowledge rl eval
knowledge rl replay [limit]
knowledge rl benchmark [episodes]
knowledge rl explain
knowledge rl use
knowledge rl benchmark is an isolated synthetic smoke test. It does not add claims to the knowledge store.