Knowledge RL
Knowledge RL is the claim-acquisition and epistemic-labeling subsystem. It keeps
claims, labels, source trust, conflicts, confidence, and Q-table state for
deciding which claim should be presented or trained next.
Main Concepts
- Claim: a text statement stored with source, priority, confidence, and trust.
- Label: true, false, depends, unknown, or unlabeled.
- Conflict: a relationship between claims that should be reviewed.
- Source trust: a 0.0 to 1.0 value used in confidence and prioritization.
- RL state: presentation counts, label history, episode reward, and Q-table
entries used by training mode.
Modes
[text]
off
acquire
train
eval
Common mode commands:
[text]
knowledge on
knowledge off
knowledge status
knowledge rl train
knowledge rl observe
knowledge rl step
knowledge rl train replay 5
knowledge rl eval
knowledge rl off
knowledge rl status
Claim Workflow
[text]
knowledge claim <statement>
knowledge next
knowledge true
knowledge false
knowledge depends
knowledge unknown
knowledge label true <claim text>
knowledge label false <claim text>
knowledge label depends <claim text>
knowledge label unknown <claim text>
knowledge next presents the next claim selected by the current policy. Direct
label commands without claim text apply to the current claim.
Stats And Exports
[text]
knowledge stats
knowledge rl stats
knowledge rl replay [limit]
knowledge rl explain
knowledge rl benchmark [episodes]
knowledge graphs
knowledge graphs to <directory>
knowledge rl graphs
knowledge rl graphs to <directory>
Graph export writes:
[text]
knowledge_rl_stats.json
knowledge_rl_stats.md
knowledge_rl_stats.csv
knowledge_rl_label_distribution.svg
knowledge_rl_confidence_histogram.svg
knowledge_rl_source_trust.svg
knowledge_rl_reward_timeline.svg
Conflicts And Trust
[text]
knowledge conflicts
knowledge trust <source_or_claim> <0.0-1.0>
Use trust updates when one source is consistently reliable or unreliable. Do not
use trust as proof by itself; it is a prioritization signal.
Checkpoints
Default files are under D:/knowledge_rl_logs unless settings override it:
[text]
claims.json
knowledge_rl_checkpoint.txt
label_transitions.csv
Commands:
[text]
knowledge save
knowledge load
knowledge save mysql
knowledge load mysql
knowledge checkpoint mysql on
knowledge checkpoint mysql off
knowledge checkpoint mysql profile <profile>
knowledge checkpoint profile <profile>
MySQL checkpoints use the ai_settings database and the configured MySQL
profile.
Lua Globals
Agents can call:
[text]
knowledge_rl_status()
knowledge_rl_stats()
knowledge_rl_stats_json()
knowledge_rl_export_graphs(path)
knowledge_rl_set_mode(mode)
knowledge_rl_get_mode()
knowledge_rl_add_claim(text)
knowledge_rl_label_claim(text, label)
knowledge_rl_label_current(label)
knowledge_rl_next_claim()
knowledge_rl_save()
knowledge_rl_load()
knowledge_rl_save_mysql()
knowledge_rl_load_mysql()
knowledge_rl_conflicts()
knowledge_rl_set_trust(source_or_claim, score)
knowledge_rl_observe()
knowledge_rl_step()
knowledge_rl_train_replay(episodes)
knowledge_rl_eval()
knowledge_rl_replay(limit)
knowledge_rl_benchmark(episodes)
knowledge_rl_explain()
knowledge_rl_use()
Recommended Use
During Training
Use Knowledge RL while building the knowledge base:
[text]
knowledge on
knowledge claim <source-backed statement>
knowledge rl observe
knowledge rl step
knowledge true|false|depends|unknown
knowledge rl train replay 5
knowledge rl eval
knowledge conflicts
knowledge rl stats
knowledge rl graphs
knowledge save
What each command does during training:
- knowledge rl observe emits the current Knowledge RL state as JSON: claims, labels, confidence, trust, conflicts, Q-table stats, current claim, available actions, and recommended next action.
- knowledge rl step runs one policy step. It reviews conflicts first, presents unlabeled/high-priority claims next, or replays training if everything is labeled.
- knowledge true|false|depends|unknown supplies the reward signal by labeling the current claim.
- knowledge rl train replay [episodes] replays already-labeled claims into the Q-table. It does not invent labels.
- knowledge rl eval reports readiness for answer review and memory consolidation.
- knowledge conflicts should be clean before using the knowledge base as strong evidence.
After Training
Use Knowledge RL after training as a quality layer:
[text]
knowledge rl eval
knowledge conflicts
knowledge rl explain
knowledge rl stats
knowledge rl graphs
knowledge save mysql
Post-training uses:
- answer review: detect unsupported, uncertain, or contradicted claims before final answers
- source triage: prefer high-trust sources and flag low-trust or high-conflict sources
- memory consolidation: store high-confidence claims and avoid saving weak claims
- research routing: decide whether to search local docs, MySQL memory, web/research agents, or specialist agents
- citation gap detection: identify claims that need stronger evidence
- agent control: expose knowledge_rl_observation to simple agents, researcher agents, and domain agents
Operational Commands
[text]
knowledge rl observe
knowledge rl step
knowledge rl train replay [episodes]
knowledge rl eval
knowledge rl replay [limit]
knowledge rl benchmark [episodes]
knowledge rl explain
knowledge rl use
knowledge rl benchmark is an isolated synthetic smoke test. It does not add claims to the knowledge store.
Filed under: Uncategorized - @ July 18, 2026 6:38 am