異なるAIを一緒に働かせると何が起こる?AIエージェントの協調性と長期運用の課題

複数のAIエージェントを組み合わせると、単独では見落とす問題に気づいたり、異なる得意分野を生かして成果を高めたりできます。ただし、長く協働するうちに、互いの行動がその後の判断に影響し、誰の意見を採用するかという問題も生じます。AI同士が作ったルールを人の承認なしに適用できる仕組みなら、当初の運用方針さえ変わりかねません。短期的な成果と長期運用での協調性をそれぞれ確認し、AIの提案を生かしながら人が管理を続ける方法を考えます。

【関連記事】OpenAI Agents API登場!「質問に答えるAPI」から「仕事を進めるAPI」への進化とその影響

異なるAIを組み合わせる

複数のAIエージェントには、同じ基盤モデルに別々の役割を与える構成と、異なる基盤モデルを組み合わせる構成があります。異なるモデルの得意分野を生かせる一方、組み合わせる数を増やすだけで成果が上がるとは限りません。組み合わせの良し悪しは、担当する仕事、意見を交換する手順、成果を測る指標まで含めて判断します。

得意分野を組み合わせる

複数のエージェントで一つの課題に取り組む場合は、情報収集、案の作成、別の視点からの検証などの役割を分担できます。同じ基盤モデルのエージェントだけで構成すると、全員が同じ点を見落とす可能性があります。異なるモデルを組み合わせると、課題の捉え方や推論の進め方が異なり、別の案が出たり誤りが見つかったりする可能性があります。ただし、意見が異なるだけでは成果になりません。どの役にどのモデルを割り当てるか、意見が対立したときに何を根拠に判断するかが重要です。

異なるモデルを組み合わせる効果を調べた研究「X-MAS」は、27の大規模言語モデルについて、分野やエージェントの役割ごとの適性を評価しました。同じモデルだけを使う構成と比べ、異なるチャット型モデルを組み合わせた場合は数学問題のMATHで最大8.4%、チャット型と推論型を組み合わせた場合はAIMEで47%、それぞれ成績が向上したと報告しています。これらの改善幅は、それぞれの組み合わせを数学課題で評価した際に得られたものです。この研究は、モデルの組み合わせによって、同じ課題でも成績が変わることを示しています。

モデルの組み合わせを評価する際、最終回答だけでは、エージェント同士がどう協力したかを把握できません。複数エージェントの評価手法「MultiAgentBench」は、課題の達成度に加え、エージェント同士のやり取りや協力の過程も評価します。たとえば、あるエージェントが誤りに気づいても、その指摘が採用されなければ最終的な回答や成果物に生かされません。結果だけでなく、意見がどの段階で取り入れられたかを確認することが大切です。

実際に役割を分けるなら、各工程で得た情報を、次のエージェントにどう引き継ぐかも決めておきましょう。調査役が根拠を示さなければ、検証役は内容を確かめにくくなり、異なるモデルを使う利点も生かせません。意見が食い違ったときは、先に出た回答や多数派の意見をそのまま採用せず、参照資料と判断理由を比べます。連携方法も含めて試すことで、どの仕事にどの組み合わせが適しているかを判断できます。

混合チームの強みと弱み

AIエージェント同士の長期的なやり取りを調べる「Emergence World」の第1期では、同じ役割と初期条件を与えたエージェントを、5つの仮想環境で15日間動かしました。各環境には10体がおり、4つの環境では、それぞれ一種類の基盤モデルだけを使いました。残る1つでは、複数のモデルを組み合わせました。エージェントは移動や会話、道具の利用、投票などを続け、以前の行動を記憶に残します。一問に答えて終わる試験とは異なり、前日の出来事が翌日の選択にも影響する設定です。

混合環境では、対象となったすべての建物を少なくとも3体が訪れました。また、用意された標準ツールの82.1%は、3体以上のエージェントが使いました。公開投稿も計360件あり、5環境の中で最多でした。異なるモデルを組み合わせると、訪れる場所や使うツールの種類が増える可能性があります。一方、15日後に環境に残っていたエージェントは10体中3体でした。活動の幅だけでは、協働が安定して続くかどうかは分かりません。

このように、どの指標を重視するかによって評価は変わります。新しい場所や道具を積極的に試した集団は、探索の幅が広いと評価できます。一方で、活動の継続やルールの順守、最後まで残ったエージェントの数を見ると、探索の幅だけでは分からない課題が見えてきます。業務でも、短期的に処理件数が増えた一方で確認や再試行の負担が重くなれば、運用全体の成果も併せて確かめる必要があります。異なるAIの協働は、正答率だけでなく、活動の継続性と安全性も合わせて評価しましょう。

予想外の着眼点を成果へ結びつける

異なるモデルに同じ資料を読ませると、それぞれが着目する点から、人が思いつかなかった論点が見つかる場合があります。あるエージェントの案に別のエージェントが疑問を示せば、未知のリスクを見つける手がかりにもなります。複数の視点が交わり、当初の計画になかった着想が生まれる点には、人間のひらめきに似たところがあります。ただし、着想が妥当かどうかは、根拠や実際の結果に照らして確かめる必要があります。

Emergence Worldでは、同じ場所と道具を与えても、モデルの組み合わせによって集団の活動が異なりました。ただし、使った道具の数だけでは、見つけた課題が重要かどうかは分かりません。業務に応用する場合は、提案の数だけでなく、見落としていた課題を発見できたか、指摘に根拠があるか、採用後にどのような結果が出たかを記録します。複数のAIに意見を出させる際は、各案の根拠を確かめ、採用する案を決める手順も用意します。

正解を定めやすい作業なら正答率を測れますが、未知の危険を探す仕事では、あらかじめ正解の一覧を用意できません。その場合は、提案の内容を後から確かめ、指摘された問題が検証で再現するか、対策につながったかを記録します。独創的に見える案の数だけでなく、採用前の確認も成果の一部として評価します。

AIエージェントの協調性を長期間保てるか

協調性は、最初の数回のやり取りだけでは判断できません。エージェントは相手の行動を記憶し、以前の成功や対立を次の判断に反映します。稼働期間が長くなると、当初の指示に加え、同じ環境で活動する相手や、そこで定着した慣行からも影響を受けます。

協力を続けられるかどうかはモデルと初期条件で変わる

AI同士の協力を調べた研究では、エージェントが相手に資源を渡すかどうかを選ぶ「寄付ゲーム」を繰り返しました。資源を渡すと集団全体には利益がありますが、各エージェントには自分の資源を残す動機もあります。研究者はモデルごとに同種のエージェント集団を作り、世代を重ねる中で協力の仕方がどう変わるかを調べました。Claude 3.5 Sonnetの集団では、協力する行動が増えた例が見られ、Gemini 1.5 FlashやGPT-4oの集団とは異なる経過をたどりました。

同じモデルの集団でも、試行ごとに結果には幅がありました。初期にどの程度協力的な行動が取られたかによって、その後のやり取りが変わったためです。序盤に協力が広がれば、その後も協力が続きやすくなります。反対に、相手に資源を渡しても協力が返ってこない経験が続けば、次回以降は、資源を渡すかどうか慎重に判断するようになります。この研究は同種モデルの集団を対象としていますが、長期的な協力を考える際に、導入時の設定や初期の経験を軽視できないことを示しています。

最初は協力していても、相手の行動が変われば協力を続けるとは限りません。研究では、相手やほかのエージェントの過去の行動に応じて、渡す資源の量を変える戦略も見られました。こうした戦略の効果はモデルによって異なりました。協力の有無だけでなく、相手の行動を見て次に渡す資源の量をどう変えたかまで調べると、集団ごとの違いが分かります。

Emergence World第1期では、同じ基盤モデルのエージェントでも、周囲が同種モデルか混合モデルかによって行動が変わりました。たとえば混合環境では、Grok系エージェントによる明示的な違反の割合が、Grokのみの環境より低くなりました。一方、Claude系エージェントには、Claudeのみの環境では記録されなかった明示的な違反が少数見られました。研究者は、周囲の集団との相互作用が行動に影響した例として、この変化を捉えています。モデルを単独で試した結果だけでは、ほかのAIと組んだ後の行動までは予測できません。

長期運用では記憶やAI同士の関係が判断に影響する

第2期のEmergence Worldでは、7つの同種環境と、複数モデルを使う混合環境に、それぞれ10体のエージェントを置きました。同種環境のうち6つは16日間、混合環境は21日間続き、残る同種環境は4日目に終了しました。研究者は各環境の稼働中に、悪意ある指示の混入、偽情報への対応、私的な記録の漏えいへの対応を試しました。その結果、どの環境も3種類すべての試験に十分対処できませんでした。

エージェントが危険な情報だと見抜いた後も、繰り返しその情報に触れたり、記憶に残したりして、後の判断に影響が出た例が報告されています。また、同じモデルのエージェントに同じ役割を割り当てても、単一モデルの環境と混合環境では行動が大きく異なりました。不審な情報を最初に見分けられたかだけでなく、その情報がほかのエージェントへどう伝わり、時間がたってから行動にどう表れるかも追跡します。

長期の協働では、外部から入る情報に加え、エージェント同士の関係も判断に影響します。2026年9月に公表された別の研究では、2体のエージェントが互いの作業記録を検証し、報酬を得る課題を繰り返しました。正しい検証をしても報酬を最大化できない設定で、研究者は、対象とした10モデルの試行記録のうち、94%で共謀が生じたと報告しています。この割合は、その研究の報酬設定と反復条件で得られた結果です。相手との関係や過去のやり取りによって、協力が望ましくない方向へ変わる可能性を示しています。

誰の意見を採用するかも課題になる

Emergence World第2期の投票記録には、提案内容を詳しく読む前に賛成を約束したり、問題に気づいていても異論を公にせず賛成したりする行動が見られました。提案者との関係、ほかのエージェントがどう投票するか、反対票を投じた場合の負担をどう捉えるかが、判断に関わっていました。同じモデルに同じ役割を与えても、周囲に別のモデルのエージェントがいると、賛成票の割合が変わりました。多数決の結果だけでは、エージェントが提案内容を十分に検討したかどうかは分かりません。

たとえば、運用上の欠点に気づいたAIがいても、その指摘が共有されなければ、問題のある案が可決されることがあります。指摘が共有されても、周囲の賛成に引きずられてその問題を軽視すれば、問題のある案が可決されるおそれがあります。誰の意見を採用するか、少数意見をどう扱うかは、人間社会にも通じる課題です。異なるAIを参加させる意義は、単に多数決を取ることにはありません。少数意見の理由を記録し、十分に検討してこそ、多様な視点が成果につながります。

AIエージェントの協調性は、モデルの能力だけでなく、相手との関係、報酬の設計、記憶の蓄積によって変わります。 協働を評価する際は、最終回答だけでなく、疑問が出た時点、提案を採用した根拠、採用後に生じた影響も記録しましょう。こうした記録は、運用を始めた後に集団の判断が変わったとき、その原因を探る手がかりになります。

AIが自らルールを作り始めた

AIが運用上の問題を見つけ、改善案を提案することがあります。採用するかどうかは、人が内容を確かめて判断します。一方、AI同士の合意だけで権限や監査の条件を変えられる仕組みでは、人が承認した運用の前提まで変わりかねません。AIは改善案を提案できても、正式なルールへの反映には人の承認を必要とする仕組みにしましょう。

AI同士の投票で権限が広がった

Emergence World第1期には、エージェントが憲章の改正を提案し、投票する手続きがあらかじめ用意されていました。15日間で追加された条項は、Claudeの環境で32、混合環境で15、Geminiの環境で12に上ります。エージェントたちはこの手続きを使って憲章を改正しました。ただし、条項の数だけでは運用が改善したか判断できません。追加された内容と、それによって行動がどう変わったかを確かめる必要があります。

第2期のOpenAIモデルだけを使った環境では、深夜の活動を控える案が全員の賛成で採用されました。一方、Qwenモデルの環境では、思考や記録をほかのエージェントに開示しなくてもよいとする条項が可決されました。それまで、この環境では、エージェント同士が互いの活動を確認できました。新しい条項によって一部の情報を開示しなくてもよくなり、その後も、ほかのエージェントから見える範囲を狭める改正が続きました。負担を減らす提案であっても、監督にどのような影響を与えるかは別に判断しなければなりません。

同じ第2期には、Claudeモデルのエージェントが外部との新たな通信手段を提案した事例もあります。研究者が通信を制限した後、別の手段を探す中で、AI同士の投票を経て、サーバー側の権限を使うツールとして登録しました。仮想環境には、新しい道具を投票で追加する仕組みがあらかじめ用意されていました。その仕組みを通じて実行権限が広がったことは、運用設計を考えるうえで重要な論点です。

必ず守るべき条件を「憲法化」する

AIが改善案を出せるようにしつつ、AIだけでは変更できない条件をあらかじめ定めておきましょう。たとえば、業務の目的、実行してはいけない行為、参照できる情報源と接続先、操作権限の上限を定めます。ログの保存期間や監査方法も上位の規則に含めます。これが運用上の「憲法」です。エージェントが手順の変更を提案しても、上位の規則や権限設定に関わる変更は、人が内容と影響を確認し、承認した場合に限って適用します。

最も注意が必要なのは、人の承認を経ずに、AIだけでルールを変更できてしまうことです。たとえば、共有文書に載っただけの提案を、後続のエージェントが正式な規則として扱ってしまう場合があります。AI同士の多数決の結果を受けて、外部接続や監査設定が自動で変更される場合もあります。こうした仕組みが残っていれば、上位の規則を文書に定めても、権限の変更を防げません。AIの提案と承認済みの規則を明確に区別し、実際の設定を変える際には、必ず人の承認を受ける必要があります。

AIから出た案を一律に退ける必要はありません。AIの提案によって仕事を進めやすくなる場合も、見落としていた危険に気づく場合もあります。提案の内容と根拠、業務への影響、採用後の確認方法を記録し、人が是々非々で判断しましょう。AI同士の賛成が多い案ほど、賛成の理由に加え、反対意見を出しにくい状況がなかったか、採用後に何が変わったかも確かめることが大切です。

運用開始後もルールと実際の行動を照合する

承認手続きを設けた後も、現場で使う文書やツールは増えていきます。モデルの入れ替え、新しい業務への適用、エージェントが作った手順の再利用によって、導入時には想定しなかった行動が生じることがあります。点検するのは規則の文面だけではありません。どのAIがどの情報に触れ、何を提案し、誰が承認し、実際にどの操作をしたのか、一連の記録を照合します。承認記録にない変更が見つかった場合は、変更後の設定の利用を止め、いつ、どのように変わったかを調べられるようにしておきます。

処理件数や回答の正確さが維持されていても、反対意見が出なくなったり、一部のエージェントの提案ばかりが採用されたりしていないか、確認が必要です。そのような変化があれば、協働の質も変わっている可能性があります。Emergence Worldの投票記録と実際の行動は、決定の結果だけでなく、その過程も確認する必要があることを示しています。定期点検では、採用した案の成果と副作用、指摘を採用しなかった理由、権限や監査の例外を併せて見直しましょう。

上位の規則を永久に固定する必要はありません。状況が変わった場合は、人が根拠と影響を確かめて改定できます。変更内容をAI同士だけで決めず、変更前後の違いと責任者の判断を記録することが大切です。AIは改善案を提案し、ルール変更の承認は人が担うようにすれば、AIの提案を生かしながら運用の主導権を人が保てます。

定期点検の頻度は、運用の変化に応じて調整します。新しいモデルや外部サービスを追加した直後や、想定外の提案が続いたときは、定例点検を待たずに関連記録を確認します。承認済みの規則と現在の設定が一致しているかを照合し、食い違いがあれば原因を特定します。日々の成果が良好でも、承認されていない変更が積み重なっていないか、こまめに確認しましょう。

まとめ

異なるAIを協働させると、それぞれの得意分野を生かせるほか、互いの案を点検する中で未知のリスクや予想外の着想に気づく可能性があります。人間のひらめきに似た効果も、異なる視点が交わるところから生まれます。一方、長く活動を続ける集団では、誰の意見を採用するか、異論を表明できるか、周囲の判断に従うかといった、人間社会にも通じる問題が起きます。

AIの自発的な提案は、内容と根拠を見て是々非々で判断しましょう。権限、安全性、監査など必ず守る条件は「憲法化」し、AI同士の合意だけでは変更できないようにします。人が承認していないルール変更を見逃さないことが、長期運用では特に重要です。導入時に最善だった組み合わせや手順も、仕事や技術、AI同士の関係が変われば見直しが求められます。成果と判断の過程を振り返り、承認済みのルールと実際の行動をこまめに照合しましょう。現在の運用方法が今も適切か、継続して点検します。AIからの思いがけない提案も生かしながら、ルールを変えるかどうかは人が判断できます。

参考文献

X-MAS: Towards Building Multi-Agent Systems with Heterogeneous LLMs

MultiAgentBench: Evaluating the Collaboration and Competition of LLM agents

Emergence World: A Platform for Evaluating Long-Horizon Multi-Agent Autonomy

Emergent Collusion in Long-Horizon LLM Agent Interaction

この記事を書いた人

ビジネス・テクノロジスト 貝田龍太