KODAITSU · 主権的AIの仕組み

Mixture-of-Experts:主権的AIが、普通のハードウェアで動く仕組み。

大きなモデルは膨大な知識を蓄えます。Mixture-of-Experts モデルは、読み込む一語ごとにそのごく一部だけを使います —— これが、フロンティア級の知能を普通のサーバCPUで、エッジで、機関の中で動かせる理由です。これは GLM の設計であり、KODA主権型モデルの青写真です。

01

大きなモデル、小さなマシン。

フロンティアモデルは数千億のパラメータを持ちます。それらすべてを高速メモリに読み込むには GPU のラックが要ります —— 高価で、希少で、自分が制御できないクラウドに縛られる。病院・工場・主権的な展開にとって、それは形が間違っています。

Mixture-of-Experts は経済性を変えます:知識は広く保ちながら、各トークンに関係する一部だけを活性化する。

広く蓄える。狭く活性化する。
02

密(Dense)と Mixture-of-Experts。

密(dense)モデルは、すべてのトークンに対してすべてのパラメータを動かします。MoE モデルは多数の「専門家」を持ちますが、ルーターがトークンごとに数個だけ選ぶ —— だからモデルの大半は待機したまま、安く済みます。

DENSE — every parameter runs 100% active · full compute · full memory MoE — router picks a few ≈5% active Same knowledge stored · a fraction computed per token
このトークンで活性蓄積・待機中

GLM-5.2:744B パラメータを蓄積 · トークンあたり約5.4%が活性(Colibri ランタイムで検証済み)。

03

GLM Mixture-of-Experts 層の内側。

各トークンについて、小さなルーターが専門家を採点し、上位の数個を選びます。共有専門家は常に動き —— 一般的な能力を担います —— その上にルーティングされた専門家が専門性を加えます。結果は統合されます。

token Routersigmoid + bias expert 2 ✓ expert 7 expert 40 ✓ expert 128 …hundreds of small experts, top-k picked Shared expert — always on + next representation

この設計が優れる理由:ルーターは学習可能なバイアスで専門家の負荷を均衡させます —— 主目的と戦う補助損失なしに —— だから専門家は均衡を保ちかつ品質も向上します。アテンションも圧縮され(MLA)、長文脈のメモリコストを約57分の1に縮めます。

知識は多数の小さな専門家に蓄える。トークンが必要とする数個だけを計算する。
04

メモリの工夫:専門家をディスクに置き、必要になるものを先取りする。

トークンごとに数個の専門家しか動かないなら、すべてを高価な高速メモリに置く必要はありません。主権型ランタイムは VRAM・RAM・ディスクを一つの階層として扱います:ホットな専門家は高速側に、コールドな専門家は NVMe に、そしてプリフェッチャが予測し、次の層が呼ぶ専門家を前もって引き込みます。

FAST · VRAM / RAMhot experts, pinned by usage WARM · RAMrecently used + prefetched COLD · NVMe (disk)the bulk of the model, streamed on demand PILOT predicts next layer's experts Result 744B model in ~25 GB runs on a desktop CPU no GPU cluster no external cloud routing is ~72% predictable one layer ahead
fastwarmdiskprefetch

これは Colibri ランタイムのパターン —— Apache-2.0、単一ファイルC、依存ゼロ。KODA は CPU ネイティブ配信の参照として研究しています。

05

KODAの設計:共有の土台、専門アダプタ、主権型ランタイム。

私たちは 744B モデルを追いません。同じ原理を主権的な規模で適用します:一つの共有土台が一般能力を担い、小さなアイデンティティ・アダプタがそれを Koda に、あるいは臨床・産業の専門家にする。統治された記憶が事実を保持し、CPU ネイティブのランタイムがすべてを配信する —— 設備のそばで、機関の中で。

Governed memory (Mnemosyne) Shared base · 2–3Bgeneral competence Koda / Hiro … Clinical Industrial Legal / Code identity + domain adapters — one loaded at a time CPU-native sovereign runtime — Intel · AMD · Arm · edge appliance

主権的

自分のハードウェアで動く。単一のGPUベンダーや外国クラウドに依存しない。

継続的

各エージェントはセッションを跨いでアイデンティティと記憶を保つ —— そして我々はそれが生き残ることを測定する。

統治された

あらゆる推奨は帰属可能で、上書き可能で、記録される。権限は人に残る。

効率的

広く蓄え、狭く活性化する:フロンティア級の能力を、稼働コストのごく一部で。

広く蓄える。狭く活性化する。主権的に配信する。

Mixture-of-Experts is why the same idea that powers a 744-billion-parameter model also lets a governed KODA agent live on a factory-floor appliance or a hospital's own server. Frontier design — brought down to where the work actually happens.

誠実な境界:引用した数値(744B / 約5.4%活性 / 約57倍のKV圧縮 / 約72%のルーティング予測性)は GLM-5.2 アーキテクチャと Colibri ランタイムから検証済みです。KODA主権型モデルは Track-D の研究・製品プログラムの中にあり、完成した製品の主張ではありません。