{"id":2058,"date":"2026-07-18T06:50:30","date_gmt":"2026-07-18T13:50:30","guid":{"rendered":"http:\/\/macdaddy4sure.ai\/?p=2058"},"modified":"2026-07-18T06:50:30","modified_gmt":"2026-07-18T13:50:30","slug":"remote-cuda-implementation","status":"publish","type":"post","link":"http:\/\/macdaddy4sure.ai\/index.php\/2026\/07\/18\/remote-cuda-implementation\/","title":{"rendered":"Remote CUDA \u2014 Implementation"},"content":{"rendered":"\n<p>Remote GPU offload for _AugmentedIntelligence: multi-worker pool, session tensors,<\/p>\n\n\n\n<p>async jobs, hybrid matmul, GUI ops strip, and a Python worker.<\/p>\n\n\n\n<p><strong>ENV defaults:<\/strong> EnvironmentVariables.md (EnvironmentVariables.md)<\/p>\n\n\n\n<h2 class=\"wp-block-heading\">Components<\/h2>\n\n\n\n<figure class=\"wp-block-table\"><table class=\"has-fixed-layout\"><tbody><tr><td><strong>Piece<\/strong><\/td><td><strong>Path<\/strong><\/td><\/tr><tr><td>Client<\/td><td>RemoteCuda.hpp \/ RemoteCuda.cpp<\/td><\/tr><tr><td>Worker<\/td><td>tools\/remote_cuda_worker.py<\/td><\/tr><tr><td>Device placement<\/td><td>MathNNDevice kind remote<\/td><\/tr><tr><td>HA RPC compat<\/td><td>HardwareAcceleration::RemoteInfer + \/infer<\/td><\/tr><tr><td>GUI<\/td><td>Ops strip summary via _RemoteCuda::OpsStripSummary<\/td><\/tr><tr><td>Commands<\/td><td>cuda remote \u2026 (also remote cuda \u2026)<\/td><\/tr><\/tbody><\/table><\/figure>\n\n\n\n<h2 class=\"wp-block-heading\">Commands<\/h2>\n\n\n\n<p><em>[text]<br><\/em>cuda remote status<br>cuda remote ping [worker_id]<br>cuda remote hello [worker_id]<br>cuda remote bench [size] [worker_id]<br>cuda remote set host &lt;url&#8230;&gt; [url2&#8230;]<br>cuda remote set token &lt;tok&gt;<br>cuda remote set timeout &lt;ms&gt;<br>cuda remote set enabled on|off<br>cuda remote job list|status &lt;id&gt;|cancel &lt;id|all&gt;|enqueue &lt;op&gt;<br>cuda remote tensor list|clear [name]|put [name]<br>cuda remote checkpoint push &lt;local&gt; [remote_name]<br>cuda remote checkpoint pull &lt;remote&gt; [local]<br>cuda remote allreduce<br>cuda remote ode [model]<br>cuda remote refresh<\/p>\n\n\n\n<h2 class=\"wp-block-heading\">Worker quick start<\/h2>\n\n\n\n<p><em>[bat]<br><\/em>set AI_REMOTE_CUDA_TOKEN=dev-token<br>set AI_REMOTE_CUDA_PORT=7720<br>python tools\\remote_cuda_worker.py &#8211;host 0.0.0.0 &#8211;port 7720<\/p>\n\n\n\n<p>Client:<\/p>\n\n\n\n<p><em>[bat]<br><\/em>set AI_REMOTE_CUDA_HOST=127.0.0.1<br>set AI_REMOTE_CUDA_PORT=7720<br>set AI_REMOTE_CUDA_TOKEN=dev-token<\/p>\n\n\n\n<p>Then: cuda remote ping \u00b7 cuda remote bench 256 \u00b7 nn device set global train remote<\/p>\n\n\n\n<h2 class=\"wp-block-heading\">Protocol<\/h2>\n\n\n\n<ul class=\"wp-block-list\">\n<li>Prefer <strong>`POST \/v1\/&lt;op>`<\/strong> with JSON { &#8220;op&#8221;, &#8220;token&#8221;, &#8220;payload&#8221;: {&#8230;} }\u00a0<\/li>\n\n\n\n<li>Fallback <strong>`POST \/infer`<\/strong> (HardwareAcceleration style)\u00a0<\/li>\n\n\n\n<li>Auth: Authorization: Bearer &lt;token> or body &#8220;token&#8221;\u00a0<\/li>\n\n\n\n<li>Ops: ping, hello, bench, matmul, allreduce, checkpoint_*, dda_volume, ode_batch, stubs for fft\/conv2d\/\u2026<\/li>\n<\/ul>\n\n\n\n<h2 class=\"wp-block-heading\">Behaviour guarantees<\/h2>\n\n\n\n<ol class=\"wp-block-list\">\n<li><strong>Local fallback<\/strong> \u2014 matmul\/bench always produce local results if remote fails.\u00a0<\/li>\n\n\n\n<li><strong>Kill-switch<\/strong> \u2014 safe mode cancels queued\/running remote jobs.\u00a0<\/li>\n\n\n\n<li><strong>Pool<\/strong> \u2014 AI_REMOTE_CUDA_HOSTS least-inflight pick.\u00a0<\/li>\n\n\n\n<li><strong>Hybrid matmul<\/strong> \u2014 remote handshake + local GEMM for correctness (full tensor ship only for tiny shapes).<\/li>\n<\/ol>\n\n\n\n<h2 class=\"wp-block-heading\">Implemented brainstorm map<\/h2>\n\n\n\n<figure class=\"wp-block-table\"><table class=\"has-fixed-layout\"><tbody><tr><td><strong>Brainstorm item<\/strong><\/td><td><strong>Status<\/strong><\/td><\/tr><tr><td>Worker daemon<\/td><td>Python HTTP worker<\/td><\/tr><tr><td>Op catalog<\/td><td>ping\/hello\/bench\/matmul\/allreduce\/checkpoint\/volume\/ode + stubs<\/td><\/tr><tr><td>Session tensors<\/td><td>Client-side registry (cuda remote tensor)<\/td><\/tr><tr><td>Capability hello<\/td><td>Worker \/v1\/hello VRAM\/CUDA fields<\/td><\/tr><tr><td>Placement policy<\/td><td>nn device set \u2026 remote<\/td><\/tr><tr><td>Async jobs<\/td><td>Background pump + cuda remote job<\/td><\/tr><tr><td>All-reduce lite<\/td><td>RPC ack + local vector<\/td><\/tr><tr><td>Checkpoint meta<\/td><td>push\/pull metadata JSON<\/td><\/tr><tr><td>ODE batch<\/td><td>RPC + local catalog fallback<\/td><\/tr><tr><td>Volume stage<\/td><td>RPC stub for RC<\/td><\/tr><tr><td>Multi-worker pool<\/td><td>HOSTS list<\/td><\/tr><tr><td>VRAM fields<\/td><td>From hello\/bench<\/td><\/tr><tr><td>Priority queues<\/td><td>Job priority field<\/td><\/tr><tr><td>Preemption<\/td><td>CancelAll on kill-switch<\/td><\/tr><tr><td>GUI ops strip<\/td><td>Remote summary<\/td><\/tr><tr><td>cuda remote * commands<\/td><td>Wired in SpeechCommands<\/td><\/tr><tr><td>Cloud adapters<\/td><td>Deferred (use HOSTS to any HTTP worker)<\/td><\/tr><\/tbody><\/table><\/figure>\n\n\n\n<h2 class=\"wp-block-heading\">Deferred \/ next<\/h2>\n\n\n\n<ul class=\"wp-block-list\">\n<li>Full float tensor upload for large matmul on worker GPU\u00a0<\/li>\n\n\n\n<li>gRPC + TLS\/mTLS\u00a0<\/li>\n\n\n\n<li>Real federated gradient merge across multi-node\u00a0<\/li>\n\n\n\n<li>Cloud marketplace adapters (RunPod\/etc.) as URL presets\u00a0<\/li>\n<\/ul>\n","protected":false},"excerpt":{"rendered":"<p>Remote GPU offload for _AugmentedIntelligence: multi-worker pool, session tensors, async jobs, hybrid matmul, GUI ops strip, and a Python worker. ENV defaults: EnvironmentVariables.md (EnvironmentVariables.md) Components Piece Path Client RemoteCuda.hpp \/ RemoteCuda.cpp Worker tools\/remote_cuda_worker.py Device placement MathNNDevice kind remote HA RPC compat HardwareAcceleration::RemoteInfer + \/infer GUI Ops strip summary via _RemoteCuda::OpsStripSummary Commands cuda remote \u2026 (also [&hellip;]<\/p>\n","protected":false},"author":1,"featured_media":0,"comment_status":"open","ping_status":"open","sticky":false,"template":"","format":"standard","meta":{"footnotes":""},"categories":[1],"tags":[],"class_list":["post-2058","post","type-post","status-publish","format-standard","hentry","category-uncategorized"],"_links":{"self":[{"href":"http:\/\/macdaddy4sure.ai\/index.php\/wp-json\/wp\/v2\/posts\/2058","targetHints":{"allow":["GET"]}}],"collection":[{"href":"http:\/\/macdaddy4sure.ai\/index.php\/wp-json\/wp\/v2\/posts"}],"about":[{"href":"http:\/\/macdaddy4sure.ai\/index.php\/wp-json\/wp\/v2\/types\/post"}],"author":[{"embeddable":true,"href":"http:\/\/macdaddy4sure.ai\/index.php\/wp-json\/wp\/v2\/users\/1"}],"replies":[{"embeddable":true,"href":"http:\/\/macdaddy4sure.ai\/index.php\/wp-json\/wp\/v2\/comments?post=2058"}],"version-history":[{"count":1,"href":"http:\/\/macdaddy4sure.ai\/index.php\/wp-json\/wp\/v2\/posts\/2058\/revisions"}],"predecessor-version":[{"id":2059,"href":"http:\/\/macdaddy4sure.ai\/index.php\/wp-json\/wp\/v2\/posts\/2058\/revisions\/2059"}],"wp:attachment":[{"href":"http:\/\/macdaddy4sure.ai\/index.php\/wp-json\/wp\/v2\/media?parent=2058"}],"wp:term":[{"taxonomy":"category","embeddable":true,"href":"http:\/\/macdaddy4sure.ai\/index.php\/wp-json\/wp\/v2\/categories?post=2058"},{"taxonomy":"post_tag","embeddable":true,"href":"http:\/\/macdaddy4sure.ai\/index.php\/wp-json\/wp\/v2\/tags?post=2058"}],"curies":[{"name":"wp","href":"https:\/\/api.w.org\/{rel}","templated":true}]}}