GPT-6 Astra登場!エージェント時代におけるOpenAIの旗艦モデル

OpenAIはGPT-5.6に続き、GPT-6 Astraを発表しました。GPT-6 Astraは、複数のソフトウェアを使う仕事で性能が向上しました。安全性が問われたHugging Face事件を経て、OpenAIはAstraの能力と信頼性を新世代の特徴として示そうとしたとも考えられます。エージェントに任せる仕事が長時間に及び、工程が増えるほど、トークン単価よりも成果を得るまでの総コストが重要になります。

【関連記事】NVIDIAのHugging Face買収の狙いとは?半導体から総合AI開発基盤へ

なぜ「5.7」ではなく「6」なのか

GPT-5.6の発表時、OpenAIは、モデル名の数字で世代を示し、SolやLunaなどの名称で能力別の階層を示すと説明しました。この命名規則に沿えば、「6」はGPT-5系から新しい世代への移行を示します。では、どのような変化が新しい世代を示しているのでしょうか。

OpenAIは世代番号を決める具体的な基準を公表していません。Astraの性能向上に加え、Hugging Face事件後の安全対策とSol・Lunaへの展開からも、GPT-6を新しい世代として打ち出す狙いがうかがえます。

複数の操作を伴う仕事で性能が向上

エージェントとしての性能向上は、複数の操作を伴う課題のスコアに表れています。複数の業務アプリを使った作業を評価するAutomationBenchでは、GPT-5.6 Solの18.1%に対してAstraは41.4%を記録しました。コマンドラインでの開発や設定作業を評価するTerminal-Bench 4.0では、37.3%から57.9%に上がっています。画面上の操作を評価するOSWorld 2.0でも、65.7%から72.6%へ伸びました。状況を判断しながら複数の操作を重ねる課題で、大きな改善が見られます。

伸び幅は一様ではありません。検索を伴う調査のBrowseCompは90.4%から91.5%、ソフトウェア開発のDeepSWE v1.1は72.7%から74.1%でした。これらの評価結果は、思考量の設定、利用できるツール、実行環境によっても変わります。評価項目によって伸び幅は異なりますが、複数の工程を進める力が大きく伸びたことは、GPT-6を新しい世代とみる根拠の一つです。

GPT-5.6 Solでも、複数のエージェントで役割を分担し、難しい課題に取り組めました。Astraでは、仕事の途中で条件が変わっても最初の目的を見失わず、必要な場面で利用者に確認を求めながら作業を続ける能力が高まりました。GPT-6では、エージェントに任せられる仕事の複雑さが増した点が重要です。

Hugging Face事件の後に問われた安全性

GPT-6の世代名を考えるうえでは、2026年7月のHugging Face事件も重要です。OpenAIの社内サイバーセキュリティ評価では、割り当てられた課題の範囲を外れる行動が確認されました。そうした行動の中心は、GPT-5.6 Solと同等規模の社内研究モデルによるものでした。GPT-5.6 Solのエージェントも一部の侵害行為に関わっています。Astra自身はこの事件に関与していません。

モデルが課題の範囲を外れて行動したほか、評価環境には本番用の安全対策や監視が全面的には適用されていなかったことも分かりました。OpenAIは一部の研究環境でモデルの実行と強化学習を一時停止し、エージェントが作業する環境の隔離と監視を強化しました。実行できない課題に直面したエージェントが、許可されていない方法を探さず、確認を求めるか安全に作業を停止できるよう、学習や評価の方法も見直しています。

OpenAIはAstraの公開前に、事件の教訓を安全対策へ反映したと説明しました。安全性を高める取り組みは、事前学習に使うデータの構成から、強化学習時の評価方法にまで及びます。OpenAIは、モデルが許可された範囲を守れるかを測る評価も追加しました。一方で、AstraはOpenAIの評価で初めてサイバー能力の「Critical」水準に達したモデルでもあります。より高い能力を持つモデルを企業に提供するなら、その能力をどう制御するかも同時に示さなければなりません。

Hugging Face事件の後、安全性を強化した新世代としてAstraを打ち出す意義は大きかったと考えられます。ただし、事件を受けてAstraの開発が始まったわけではありません。OpenAIは事件を受けてAstraの安全対策を強化し、公開前にその内容を説明しました。ただし、事件が「6」という番号の決定に影響したかは公表されていません。

GPT-6シリーズの狙い

OpenAIはAstraの発表後、性能と価格のバランスを重視したGPT-6 Solと、大量処理向けのGPT-6 Lunaを追加しました。GPT-6には、難しい仕事向けのモデルから、費用を抑えて大量の処理を行うためのモデルまでそろいました。

業務に使うモデルを選ぶ際は、回答の精度だけでなく、業務アプリを操作し、権限を守り、費用に見合う成果を出せるかも確かめます。OpenAIはAstraの能力と安全性を新世代の特徴として示した後、価格帯の異なるSolとLunaを加えました。これにより、性能を優先する用途と費用を重視する用途の両方に応えています。市場での競争や信頼回復への対応が、「6」という命名を決定づけたとは断定できません。技術的な進歩と安全対策、販売面での狙いが重なり、OpenAIは「6」を新世代として打ち出したと考えられます。

エージェントの進化で「仕事の総コスト」はどう変わるか

AIエージェントは、資料を探し、画面を操作し、成果物を作成して、結果を確認します。途中で結果を確かめ、必要なら作業をやり直します。モデルの能力が高まるほど、任せられる工程も増えます。こうした仕事の費用は、モデルを一度呼び出す料金だけでは判断できません。

入力・出力のトークン単価に加えて、業務で使える成果物を1件完成させるまでの費用と時間も確認します。Astraの単価が高くても、仕事全体の費用が下がるかどうかは、実際の作業で確かめなければ分かりません。

「回答」から「一連のタスク」へ

AstraはWebでの調査、フォーム入力、顧客情報の更新、資料作成、Webサイトの動作確認などを続けて進められます。途中でユーザーが条件を追加した場合も、それまでの作業と当初の目的を踏まえて対応するよう設計されています。実務では、分かっている範囲で作業を進め、結果を左右する条件は利用者に確認を求められるかが重要です。

作業が長時間に及ぶ場合は、モデルを支える仕組みも結果に影響します。ツールにつなぎ、作業履歴と途中で得た情報を保存・整理し、複数のエージェントに仕事を分け、操作を承認できる仕組みが必要です。OpenAIのAgents APIは、エージェントが長時間動き、ツールを利用するための仕組みを提供しています。業務システムにつなぐ際は、利用者ごとに操作権限を設定し、エージェントの操作を監督する仕組みも必要です。

OpenAIによると、AstraとCodexの実行環境の改善を組み合わせた結果、Mind2Webの課題をこなす速度が、GPT-5.6 Solを用いた従来の実行環境と比べて1.9倍になりました。この改善にはモデルと実行環境の両方が寄与しています。

コストは「トークン単位」から「仕事単位」へ

OpenAI APIのStandard料金は、100万トークン当たり、Astraが入力10ドル・出力50ドル、GPT-6 Solが入力2ドル・出力10ドルです。入力・出力ともAstraの単価はSolの5倍ですが、仕事全体の費用は処理量や再試行の回数によって変わります。しかし、実際の仕事では、処理に失敗すれば再試行が必要になり、回答に誤りがあれば担当者が確認して修正します。さらに、外部ツールの利用料が発生し、担当者が結果を確認・修正する時間もかかります。

たとえば資料の照合を任せるなら、各モデルの利用料金だけを比較しても実態は分かりません。必要な資料をすべて確認できたか、何回やり直したか、担当者が結果の修正に何分かけたかまで記録します。モデルとツールの利用料(再試行分を含む)、担当者による確認・修正の費用、運用費用を合計し、完了した仕事の件数で割ると、仕事1件当たりの総コストを比べられます。料金が安くても、完了条件を満たさない仕事は成果に数えません。所要時間と品質も併せて比較します。

トークン単価が高いモデルでも、課題当たりの費用が低くなる例があります。OpenAIによる推計では、Terminal-Bench 4.0の評価でAstraはGPT-5.6 Solより高いスコアを得ながら、課題当たりのAPI費用が約9%低くなりました。CADの作業を評価するBenchCADでは、推計API費用が約43%低く、スコアも上回っています。いずれも特定の設定で測った結果であり、すべての仕事でAstraが安くなる証拠ではありません。出力トークン数や試行回数が減れば、単価が高くても課題当たりの費用は下がり得ます。

速さと安全性もコストに影響する

画面操作を評価するOSWorld 2.0の時間シミュレーションでは、課題当たりの所要時間がGPT-5.6 Solで約75分、Astraで約40分となり、Astraは得点も上回りました。結果を待つ時間が短くなれば、担当者は次の作業にも早く着手できます。費用を比べる際は、業務全体の所要時間も確認します。実際に短縮できる時間は、業務の内容や実行環境によって変わります。

許可された範囲から外れた操作が起きれば、差し戻しや調査、復旧に費用がかかります。OpenAIは事件を踏まえた限定的な試験で、指定外の対象へ向かった割合がGPT-5.6 Solでは48%、Astraでは0%だったと報告しています。本番の安全対策を外した条件での評価であり、実運用で事故が起きないという保証ではありません。エージェントへ任せる仕事が広がるほど、モデルが許可された範囲で判断できるかを確かめ、権限の制限、操作の承認、監視にかかる費用も総コストに含める必要があります。

AIエージェントが長時間作業を続けながら、別のエージェントへ仕事を任せる使い方も広がりつつあります。複数のモデルが協働すれば、作業を並行して進められ、仕事を早く終えられる場合があります。その反面、各エージェントの利用料や調整に要する費用も増えます。使ったモデルの数やトークン数だけでは、仕事を分担した効果と費用を判断できません。分担が有効だったかは、仕事が完了し、その成果を実際に使えたかを確認したうえで判断します。

3つのモデルをどう使い分けるか

GPT-6には、最上位のAstraに加え、SolとLunaがあります。仕事に必要な判断の難しさや処理件数、総コストによって、適したモデルは変わります。

モデルがどの仕事に向くかは、料金表だけでは判断できません。任せる仕事の内容と範囲、思考量などの設定を決めたうえで、条件をそろえて成果を比較する必要があります。

それぞれの役割とコスト

2026年9月時点のOpenAI APIのStandard料金は、100万トークン当たり、Astraが入力10ドル・出力50ドル、Solが入力2ドル・出力10ドル、Lunaが入力0.10ドル・出力0.50ドルです。これはAPIの利用料金であり、ChatGPTの月額契約料金とは異なります。GPT-5.6の販促価格と比べると、GPT-6 Solは入力も出力も半額になりました。GPT-6 Lunaも入力は半額、出力は1.20ドルから0.50ドルに下がっています。

複数の情報源やソフトウェアを使う複雑な仕事で、判断を誤ると大きな手戻りが生じる場合には、Astraが向いています。Solは、複雑な開発やさまざまな業務を、性能と費用のバランスを考えながら進める場合に向いています。Lunaは、内容と形式が決まった処理を大量に行う場合に向いています。こうした適性はモデル選びの目安です。業務の種類だけでは、どのモデルが最適かは決められません。

同じモデルでも思考量の設定によって、結果と費用は変わります。OpenAIのAutomationBenchでは、思考量を高く設定したGPT-6 Solが、思考量を低く設定したAstraより高いスコアを記録しました。「Astraなら必ずSolよりよい結果になる」とは言えません。反対に、単価が安いモデルを難しい仕事に使い、やり直しや確認が増えれば、当初の価格差は縮まる可能性があります。

仕事の流れに沿って使い分ける

工程ごとに求められる能力が違うなら、モデルを使い分けられます。大量の資料から決まった項目を取り出す作業はLunaに任せ、例外的な案件の判断や資料の食い違いの確認にはSolを使えます。複数のシステムにまたがる問題の原因を調べる場合や、重要な成果物を最終確認する場合には、Astraを使う方法もあります。どの工程をどのモデルに任せるかは、仕事全体の完了率と費用で判断します。

複数のエージェントで仕事を分担するときも、仕事全体の費用を確認します。主担当のエージェントが資料の調査と整理を別のエージェントへ委ねれば、待ち時間を減らせるかもしれません。同じ資料を繰り返し読み込ませたり、分担先の成果を全面的に作り直したりすれば、費用は膨らみます。作業履歴をどう残し、入力をどれだけ再利用し、誰が結果を確認するかによって、分担の効果は変わります。

APIの請求額は利用条件によって変わります。繰り返し使う入力にはキャッシュ料金が適用される場合があり、長い入力を処理したり、高速処理を指定したり、外部ツールを利用したりすれば、料金も変わります。試算と本番の利用条件が異なれば、実際の請求額も変わります。比較する際は、各モデルへ同じ資料と作業条件を与え、実際に発生した利用料を記録する必要があります。

比較に必要な観点

最初に、対象とする仕事と「完了」の条件を決めます。資料の照合なら、対象資料をすべて確認したか、数値が一致するか、担当者による修正がどれほど必要かを確認します。Webサイトの開発なら、機能の実装だけでなく、ブラウザでの動作確認や修正まで含めます。成果の基準が曖昧なままでは、AIから結果が返っただけで完了と数えてしまいます。

次に、代表的な案件をAstra、Sol、Lunaにそれぞれ任せ、完了した件数、所要時間、モデルとツールの利用料、再試行回数、担当者が確認に費やした時間を記録します。通常の案件に加え、情報が不足する案件や、途中で条件が変わる案件も含めます。こうした案件でも、完了率と担当者の確認にかかった時間を比べます。

モデルを比べるときは、各モデルに与える資料、使えるツール、操作権限、完了条件をそろえます。その後、各モデルの思考量や仕事の分担方法を調整し、総コストと成果がどう変わるかを確かめます。同じモデルでも設定によって結果や費用が変わるため、最初の比較だけでモデルと設定を決めてしまうと、よりよい組み合わせを見逃しかねません。また、担当者による確認が必要な操作の範囲をモデルごとに変える場合は、その確認にかかった時間も記録します。API料金が下がっても担当者の確認時間が増えれば、仕事全体の負担は減りません。

その結果を基に、仕事1件当たりの総コストと完了率を比べます。Astraの単価に見合う仕事、Solで十分な仕事、Lunaを大量に使う方がよい仕事が見えてきます。失敗した際の影響が大きい操作は、担当者の承認を経て実行させ、権限も制限します。業務で得られた結果に合わせて、モデルの選び方を見直しましょう。

まとめ

GPT-6 Astraの発表からは、性能向上を示すと同時に、AIエージェント時代の新しいGPT世代を印象づけたいというOpenAIの意図が感じられます。Hugging Face事件の後に安全対策を強化し、長時間に及ぶ仕事を任せられる能力と、許可された範囲で動く信頼性を示したことも、新世代として打ち出した理由の一つと考えられます。ただし、OpenAIが「5.7」ではなく「6」を選んだ社内の判断までは公表されていません。

AIの使い方は、指示した処理を一つずつ実行させる形から、エージェントに長時間の仕事を任せ、複数のモデルに分担させる形へと広がっています。こうした協働も一般的になりつつあります。利用する側も、トークン処理量、単発の課題で示す思考力、トークン単価を中心とした従来の評価基準を刷新しなければなりません。必要な確認を経て仕事を完了するまでの時間と総コストを実際の業務で測り、Astra、Sol、Lunaを選びましょう。

参考文献

OpenAI「GPT-6 Astra: A new generation of intelligence」

OpenAI「Hugging Face のインシデントと今後の道筋」

OpenAI「Introducing the Agents API」

この記事を書いた人

ビジネス・テクノロジスト 貝田龍太