Agensh、1024体の自律協調で精度向上
中央の調整役を置かず、最大1,024のAIエージェントが自律的に分業する基盤「Agensh」が提案された。台数の増加が難課題の成功率を押し上げ、納期が固定された開発業務に新たな選択肢を示す。

研究の概要
Zhihao Zhan氏らの研究チームは、中央の調整役を持たない自己組織型のマルチエージェント基盤「Agensh」を発表した。従来の基盤は、オーケストレーターと呼ばれる司令役がタスクを割り振り、作業者を取りまとめる構成が多く、その処理能力が台数拡大の上限となっていた。
Agenshでは各ワーカーが、文脈の収集、サブタスクの確保と自己割り当て、実行と知見の共有、結果の検証、進捗の統合という一連の循環を非同期で繰り返す。基盤には、提案・進行中・完了の作業を保持する共有ワークスペース、ワーカー間のメッセージ窓口、再利用できる知見や作業意図を残す共有コンテキストの三要素を備える。
評価にはソフトウェア開発の難度を測るProgramBenchの最難関5課題を用い、GPT-5.6-sol(high)を使った。エージェントを1体から128体に増やすと、平均の最終テスト合格率は19.31%から28.78%へ上昇し、相対で約49%の改善となった。規模の大きい組織ほど、同水準の合格率により早く到達した。文書変換ツールpandocの課題では、1体から1,024体への拡大で合格率が33.89%から55.06%に伸びた。ワーカーの行動記録からは、組織の拡大に伴い、多様な自己組織的協調の形が徐々に現れ、定型化していく様子も確認された。
ビジネスへの示唆
最も直接の影響を受けるのは、システム開発部門と品質保証部門である。基幹システムの刷新、旧言語からの移行、テスト整備のように、作業が分割可能で納期が固定された案件では、人員の追加に代わってエージェント台数を増やす選択肢が生じる。想定される業種は、勘定系システムの更改を抱える金融機関や、組み込みソフトの保守が長期化しやすい製造業である。追うべき指標は次のとおりである。
- 開発リードタイムと納期遵守率
- テスト合格率と欠陥の流出率
- 一機能あたりの開発コスト
情報システム部門や経営企画部門にとっては、投資判断の軸も変わる。これまでのエージェント導入は、モデルの性能や単体の生産性で比較されがちだった。本研究は、台数そのものが成果を左右する調整可能な変数であることを示した。納期を守るために計算資源へどれだけ配分するかという、時間とコストの交換条件で予算を設計する発想が求められる。
一方、留意点も多い。第一に、最高値でも合格率は約55%にとどまり、人手によるレビューと受け入れ検証は不可欠である。第二に、台数増加に伴う計算コストやAPI利用料の増加幅は、要旨からは読み取れない。第三に、中央の司令役がないため、誰がどの判断をしたかの追跡が課題となる。共有ワークスペースの履歴を監査証跡として整備できるかが、内部統制を担う管理部門の論点となる。
今後の展望
研究チームは、エージェント数をマルチエージェント組織の新たな拡張軸と位置づけ、厳しい遅延制約や時間予算の下で複雑な課題を解く実用的な手段になりうると主張している。今後は、ベンチマーク外の実務コードでの再現性、費用対効果、監査可能性が実用化の鍵となる。企業は、まず納期が固定された限定的な開発案件で、台数と成果の関係を自社で計測し、追加投資の水準を見極めることが現実的である。
関連トピック
同セクションの記事
StableVQ、画像トークナイザの学習失敗を抑える
画像を離散トークンに変換するVQトークナイザーの学習を安定化する手法StableVQが公開された。学習の失敗や再実行という開発コストの要因に対処し、画像生成AIの開発効率向上に資する可能性がある。

AI開発エージェント、本番推論の壁を可視化
推論サーバー開発をAIエージェントに任せられるかを測る新ベンチマーク「SWE-Serve」が公開された。最良構成の平均正答率は75%だが、E2Eテストを加えると合格率は大きく下がった。

新手法CliffCompaction、費用を最大5割削減
長時間動作するコーディングAI向けの文脈圧縮手法「CliffCompaction」が、性能を維持したまま費用を最大50%削減した。並列試行の効率も高まり、開発現場のAI運用費に影響する可能性がある。
