{"id":2000,"date":"2026-07-18T06:38:55","date_gmt":"2026-07-18T13:38:55","guid":{"rendered":"http:\/\/macdaddy4sure.ai\/?p=2000"},"modified":"2026-07-18T06:38:55","modified_gmt":"2026-07-18T13:38:55","slug":"knowledge-rl","status":"publish","type":"post","link":"http:\/\/macdaddy4sure.ai\/index.php\/2026\/07\/18\/knowledge-rl\/","title":{"rendered":"Knowledge RL"},"content":{"rendered":"\n<p>Knowledge RL is the claim-acquisition and epistemic-labeling subsystem. It keeps<\/p>\n\n\n\n<p>claims, labels, source trust, conflicts, confidence, and Q-table state for<\/p>\n\n\n\n<p>deciding which claim should be presented or trained next.<\/p>\n\n\n\n<h2 class=\"wp-block-heading\">Main Concepts<\/h2>\n\n\n\n<ul class=\"wp-block-list\">\n<li>Claim: a text statement stored with source, priority, confidence, and trust.<\/li>\n\n\n\n<li>Label: true, false, depends, unknown, or unlabeled.<\/li>\n\n\n\n<li>Conflict: a relationship between claims that should be reviewed.<\/li>\n\n\n\n<li>Source trust: a 0.0 to 1.0 value used in confidence and prioritization.<\/li>\n\n\n\n<li>RL state: presentation counts, label history, episode reward, and Q-table<\/li>\n<\/ul>\n\n\n\n<p>&nbsp; entries used by training mode.<\/p>\n\n\n\n<h2 class=\"wp-block-heading\">Modes<\/h2>\n\n\n\n<p><em>[text]<br><\/em>off<br>acquire<br>train<br>eval<\/p>\n\n\n\n<p>Common mode commands:<\/p>\n\n\n\n<p><em>[text]<br><\/em>knowledge on<br>knowledge off<br>knowledge status<br>knowledge rl train<br>knowledge rl observe<br>knowledge rl step<br>knowledge rl train replay 5<br>knowledge rl eval<br>knowledge rl off<br>knowledge rl status<\/p>\n\n\n\n<h2 class=\"wp-block-heading\">Claim Workflow<\/h2>\n\n\n\n<p><em>[text]<br><\/em>knowledge claim &lt;statement&gt;<br>knowledge next<br>knowledge true<br>knowledge false<br>knowledge depends<br>knowledge unknown<br>knowledge label true &lt;claim text&gt;<br>knowledge label false &lt;claim text&gt;<br>knowledge label depends &lt;claim text&gt;<br>knowledge label unknown &lt;claim text&gt;<\/p>\n\n\n\n<p>knowledge next presents the next claim selected by the current policy. Direct<\/p>\n\n\n\n<p>label commands without claim text apply to the current claim.<\/p>\n\n\n\n<h2 class=\"wp-block-heading\">Stats And Exports<\/h2>\n\n\n\n<p><em>[text]<br><\/em>knowledge stats<br>knowledge rl stats<br>knowledge rl replay [limit]<br>knowledge rl explain<br>knowledge rl benchmark [episodes]<br>knowledge graphs<br>knowledge graphs to &lt;directory&gt;<br>knowledge rl graphs<br>knowledge rl graphs to &lt;directory&gt;<\/p>\n\n\n\n<p>Graph export writes:<\/p>\n\n\n\n<p><em>[text]<br><\/em>knowledge_rl_stats.json<br>knowledge_rl_stats.md<br>knowledge_rl_stats.csv<br>knowledge_rl_label_distribution.svg<br>knowledge_rl_confidence_histogram.svg<br>knowledge_rl_source_trust.svg<br>knowledge_rl_reward_timeline.svg<\/p>\n\n\n\n<h2 class=\"wp-block-heading\">Conflicts And Trust<\/h2>\n\n\n\n<p><em>[text]<br><\/em>knowledge conflicts<br>knowledge trust &lt;source_or_claim&gt; &lt;0.0-1.0&gt;<\/p>\n\n\n\n<p>Use trust updates when one source is consistently reliable or unreliable. Do not<\/p>\n\n\n\n<p>use trust as proof by itself; it is a prioritization signal.<\/p>\n\n\n\n<h2 class=\"wp-block-heading\">Checkpoints<\/h2>\n\n\n\n<p>Default files are under D:\/knowledge_rl_logs unless settings override it:<\/p>\n\n\n\n<p><em>[text]<br><\/em>claims.json<br>knowledge_rl_checkpoint.txt<br>label_transitions.csv<\/p>\n\n\n\n<p>Commands:<\/p>\n\n\n\n<p><em>[text]<br><\/em>knowledge save<br>knowledge load<br>knowledge save mysql<br>knowledge load mysql<br>knowledge checkpoint mysql on<br>knowledge checkpoint mysql off<br>knowledge checkpoint mysql profile &lt;profile&gt;<br>knowledge checkpoint profile &lt;profile&gt;<\/p>\n\n\n\n<p>MySQL checkpoints use the ai_settings database and the configured MySQL<\/p>\n\n\n\n<p>profile.<\/p>\n\n\n\n<h2 class=\"wp-block-heading\">Lua Globals<\/h2>\n\n\n\n<p>Agents can call:<\/p>\n\n\n\n<p><em>[text]<br><\/em>knowledge_rl_status()<br>knowledge_rl_stats()<br>knowledge_rl_stats_json()<br>knowledge_rl_export_graphs(path)<br>knowledge_rl_set_mode(mode)<br>knowledge_rl_get_mode()<br>knowledge_rl_add_claim(text)<br>knowledge_rl_label_claim(text, label)<br>knowledge_rl_label_current(label)<br>knowledge_rl_next_claim()<br>knowledge_rl_save()<br>knowledge_rl_load()<br>knowledge_rl_save_mysql()<br>knowledge_rl_load_mysql()<br>knowledge_rl_conflicts()<br>knowledge_rl_set_trust(source_or_claim, score)<br>knowledge_rl_observe()<br>knowledge_rl_step()<br>knowledge_rl_train_replay(episodes)<br>knowledge_rl_eval()<br>knowledge_rl_replay(limit)<br>knowledge_rl_benchmark(episodes)<br>knowledge_rl_explain()<br>knowledge_rl_use()<\/p>\n\n\n\n<h2 class=\"wp-block-heading\">Recommended Use<\/h2>\n\n\n\n<h3 class=\"wp-block-heading\">During Training<\/h3>\n\n\n\n<p>Use Knowledge RL while building the knowledge base:<\/p>\n\n\n\n<p><em>[text]<br><\/em>knowledge on<br>knowledge claim &lt;source-backed statement&gt;<br>knowledge rl observe<br>knowledge rl step<br>knowledge true|false|depends|unknown<br>knowledge rl train replay 5<br>knowledge rl eval<br>knowledge conflicts<br>knowledge rl stats<br>knowledge rl graphs<br>knowledge save<\/p>\n\n\n\n<p>What each command does during training:<\/p>\n\n\n\n<ul class=\"wp-block-list\">\n<li>knowledge rl observe emits the current Knowledge RL state as JSON: claims, labels, confidence, trust, conflicts, Q-table stats, current claim, available actions, and recommended next action.<\/li>\n\n\n\n<li>knowledge rl step runs one policy step. It reviews conflicts first, presents unlabeled\/high-priority claims next, or replays training if everything is labeled.<\/li>\n\n\n\n<li>knowledge true|false|depends|unknown supplies the reward signal by labeling the current claim.<\/li>\n\n\n\n<li>knowledge rl train replay [episodes] replays already-labeled claims into the Q-table. It does not invent labels.<\/li>\n\n\n\n<li>knowledge rl eval reports readiness for answer review and memory consolidation.<\/li>\n\n\n\n<li>knowledge conflicts should be clean before using the knowledge base as strong evidence.<\/li>\n<\/ul>\n\n\n\n<h3 class=\"wp-block-heading\">After Training<\/h3>\n\n\n\n<p>Use Knowledge RL after training as a quality layer:<\/p>\n\n\n\n<p><em>[text]<br><\/em>knowledge rl eval<br>knowledge conflicts<br>knowledge rl explain<br>knowledge rl stats<br>knowledge rl graphs<br>knowledge save mysql<\/p>\n\n\n\n<p>Post-training uses:<\/p>\n\n\n\n<ul class=\"wp-block-list\">\n<li>answer review: detect unsupported, uncertain, or contradicted claims before final answers<\/li>\n\n\n\n<li>source triage: prefer high-trust sources and flag low-trust or high-conflict sources<\/li>\n\n\n\n<li>memory consolidation: store high-confidence claims and avoid saving weak claims<\/li>\n\n\n\n<li>research routing: decide whether to search local docs, MySQL memory, web\/research agents, or specialist agents<\/li>\n\n\n\n<li>citation gap detection: identify claims that need stronger evidence<\/li>\n\n\n\n<li>agent control: expose knowledge_rl_observation to simple agents, researcher agents, and domain agents<\/li>\n<\/ul>\n\n\n\n<h3 class=\"wp-block-heading\">Operational Commands<\/h3>\n\n\n\n<p><em>[text]<br><\/em>knowledge rl observe<br>knowledge rl step<br>knowledge rl train replay [episodes]<br>knowledge rl eval<br>knowledge rl replay [limit]<br>knowledge rl benchmark [episodes]<br>knowledge rl explain<br>knowledge rl use<\/p>\n\n\n\n<p>knowledge rl benchmark is an isolated synthetic smoke test. It does not add claims to the knowledge store.<\/p>\n","protected":false},"excerpt":{"rendered":"<p>Knowledge RL is the claim-acquisition and epistemic-labeling subsystem. It keeps claims, labels, source trust, conflicts, confidence, and Q-table state for deciding which claim should be presented or trained next. Main Concepts &nbsp; entries used by training mode. Modes [text]offacquiretraineval Common mode commands: [text]knowledge onknowledge offknowledge statusknowledge rl trainknowledge rl observeknowledge rl stepknowledge rl train replay [&hellip;]<\/p>\n","protected":false},"author":1,"featured_media":0,"comment_status":"open","ping_status":"open","sticky":false,"template":"","format":"standard","meta":{"footnotes":""},"categories":[1],"tags":[],"class_list":["post-2000","post","type-post","status-publish","format-standard","hentry","category-uncategorized"],"_links":{"self":[{"href":"http:\/\/macdaddy4sure.ai\/index.php\/wp-json\/wp\/v2\/posts\/2000","targetHints":{"allow":["GET"]}}],"collection":[{"href":"http:\/\/macdaddy4sure.ai\/index.php\/wp-json\/wp\/v2\/posts"}],"about":[{"href":"http:\/\/macdaddy4sure.ai\/index.php\/wp-json\/wp\/v2\/types\/post"}],"author":[{"embeddable":true,"href":"http:\/\/macdaddy4sure.ai\/index.php\/wp-json\/wp\/v2\/users\/1"}],"replies":[{"embeddable":true,"href":"http:\/\/macdaddy4sure.ai\/index.php\/wp-json\/wp\/v2\/comments?post=2000"}],"version-history":[{"count":1,"href":"http:\/\/macdaddy4sure.ai\/index.php\/wp-json\/wp\/v2\/posts\/2000\/revisions"}],"predecessor-version":[{"id":2001,"href":"http:\/\/macdaddy4sure.ai\/index.php\/wp-json\/wp\/v2\/posts\/2000\/revisions\/2001"}],"wp:attachment":[{"href":"http:\/\/macdaddy4sure.ai\/index.php\/wp-json\/wp\/v2\/media?parent=2000"}],"wp:term":[{"taxonomy":"category","embeddable":true,"href":"http:\/\/macdaddy4sure.ai\/index.php\/wp-json\/wp\/v2\/categories?post=2000"},{"taxonomy":"post_tag","embeddable":true,"href":"http:\/\/macdaddy4sure.ai\/index.php\/wp-json\/wp\/v2\/tags?post=2000"}],"curies":[{"name":"wp","href":"https:\/\/api.w.org\/{rel}","templated":true}]}}