Gemini 4 Argonとは?性能・料金・いつ使えるかと他の5モデルとの違い

Googleが2026年9月30日、GPT-6 AstraやClaudeの上位モデルと並べた18項目の評価のうち12項目で単独1位となった「Gemini 4 Argon」を発表しました。出力できる量の上限は100万トークンで、導入価格はGPT-6 Astraの5分の1に設定されています。
ただし、発表の時点でGemini 4 Argonを使えるのは、審査を通ったサイバー防御の組織とGoogle社内に限られます。一般の会社はまだ試せないため、発表資料の数字から自社の仕事に役立つかを見極める段階です。この記事では、Gemini 4 Argonの特徴・ベンチマークの結果・料金・提供時期と、GPT-6 AstraやClaudeなど5つのモデルとの違いを解説します。
記事を読めば、公開後にGemini 4 Argonへ任せたい仕事と、今使うべきモデルを判断できます。法務・金融の調査や長い資料を扱う仕事はGemini 4 Argonの公開を待つ価値があり、公開までは今使えるモデルで仕事を進めるのが現実的です。
Gemini 4 Argonとは?Googleが2026年9月30日に発表した最上位モデル
Gemini 4 Argonは、GoogleのAIモデル「Gemini」の新しい世代にあたるモデルです。Gemini 4 Argonの基本は、以下の4つに分けると理解しやすくなります。
- 2026年9月30日にGoogleが発表した新しい世代の最上位モデル
- 名前の読み方は「アルゴン」で由来は公表されていない
- 得意な分野はコーディング・知的作業・サイバー防御・創作の文章
- Google社内では数千人の社員がすでに仕事に使っている
2026年9月30日にGoogleが発表した新しい世代の最上位モデル
Gemini 4 Argonは、Googleが2026年9月30日に公式ブログで発表したAIモデルです。発表の記事は「次の時代のフロンティア知能」と題され、Gemini 4 ArgonはGoogleの最上位のモデルに位置付けられています。
フロンティアモデルとは、AIの開発企業がその時点で最も高い性能を目指して作る最上位のモデルを指します。OpenAIのGPT-6 AstraやAnthropicのClaude Fable 5.1も、同じ位置付けのモデルです。
Gemini 4 Argonの登場で、Googleの最上位モデルが入れ替わりました。Googleのこれまでの上位モデルと、Gemini 4 Argonの状況は、以下の表のとおりです。
| モデル | 発表日 | 2026年10月1日時点の状況 |
|---|---|---|
| Gemini 3.1 Pro | 2026年2月19日 | プレビュー版として提供中 |
| Gemini 4 Argon | 2026年9月30日 | Fairwindプログラムの参加組織とGoogle社内だけに提供中 |
Fairwindプログラムは、審査を通ったサイバー防御の組織に、Googleの先進的なAIモデルを早く提供する取り組みです。
Gemini 3.1 Proは、2026年2月の発表の時点で、複雑な仕事に向くGoogleの最も高度なモデルでした。Gemini 4の世代では、Gemini 4 Argon以外のモデル(Flashなど)は2026年10月1日時点で発表されていません。
名前の読み方は「アルゴン」で由来は公表されていない
Gemini 4 Argonの「Argon」は「アルゴン」と読みます。Geminiの読み方は「ジェミニ」です。
Argonは、元素のアルゴンと同じつづりです。
Googleは、Argonという名前を選んだ理由を2026年10月1日時点で公表していません。Geminiのモデルには、これまで「Pro」「Flash」のような呼び方が付けられてきました。Gemini 4 Argonでは、ProやFlashではなくArgonという新しい呼び方が使われています。
発表前のリーク情報では、Googleの次のモデルが「Gemini 4 Pro」の名前で取り上げられていました。Googleが発表した正式な名前はGemini 4 Argonです。
得意な分野はコーディング・知的作業・サイバー防御・創作の文章
Gemini 4 Argonは、長く複雑な仕事の流れを最後まで進める用途に向けて作られたモデルです。Googleが発表でGemini 4 Argonの強みに挙げた分野は、以下の4つです。
- 実務のソフトウェア開発(コーディング)
- 法務や金融などの企業の知的作業
- サイバー攻撃から組織を守るサイバー防御
- 創作の文章
知的作業とは、調査・分析・文書作成のように、専門知識を使って進める事務や専門職の仕事を指します。Gemini 4 Argonは、法律の調査や金融の分析のように、複数の手順が続く仕事での性能を重視しています。
創作の文章については、他のモデルと比べた評価の点数が公表されていません。コーディング・知的作業・サイバー防御の3分野は、他のモデルと比べた評価の点数が公表されています。
Google社内では数千人の社員がすでに仕事に使っている
Gemini 4 Argonは、一般に公開される前から、数千人のGoogle社員が専門的なコーディング・深い調査・文章の改善に使っています。Googleが公表した社内での主な成果は、以下の表のとおりです。
| 分野 | Gemini 4 Argonを使った成果 |
|---|---|
| 量子コンピューター | 計算資源の使い方の最適化で、公表済みの基準を数分で40%上回った |
| データセンター | サーバーの性能データを分析してメモリの最適化を自動で適用し、300TiB以上のメモリを空けた |
| プログラムの移行 | C/C++で書かれた大規模なプログラムをRustへ移した。対象には80万行以上あるFuchsia OSのZirconカーネルも含まれる |
データセンターでは、全体で500TiBから1PiBのメモリの節約を見込んでいます。TiB(テビバイト)とPiB(ペビバイト)はデータの量を表す単位で、C/C++とRustはプログラミング言語の名前です。
社内の成果は、Googleが自社の環境で出した結果です。他社の仕事で同じ成果が出ることを示す数字ではありません。
Gemini 4 Argonの5つの特徴
Gemini 4 Argonは、長時間の作業を1回の流れで進める力を重視したモデルです。発表資料から読み取れる主な特徴は、以下の5つです。
- 1回で出力できる量が100万トークンと大きい
- 長時間のソフトウェア開発を最後まで進められる
- 法務・金融などの知的作業で高い点数を出した
- サイバー防御で実際の脆弱性を見つける力が高い
- 長い資料・動画・専門的なグラフを読み取れる
1回で出力できる量が100万トークンと大きい
トークンは、AIが文章を処理するときの単位です。Gemini 4 Argonは、1回の回答で最大100万トークンまで出力できます。Gemini 3.1 Proの出力の上限は65,536トークンで、Gemini 4 Argonでは約15倍に広がりました。
出力の上限が大きいと、長い報告書やプログラムを途中で切らずに書き出せます。
100万トークンの出力枠は、より深く考えながら、手順の多い問題を一度に解くための余地です。Gemini 4 Argonは、1回の作業の流れの中で数十万トークンを生成できるように作られています。
Gemini 4 Argonの100万トークンは、GPT-6 Astra・Claude Fable 5.1・Gemini 3.1 Proなどの最大出力を大きく上回ります。
100万トークンなのは出力の上限で、入力の上限ではありません。1回で読み込める量(コンテキストウィンドウ)は、2026年10月1日時点で未公表です。
長時間のソフトウェア開発を最後まで進められる
Gemini 4 Argonは、時間のかかるソフトウェア開発の課題で高い点数を出しました。長い開発の課題をAIに解かせる評価DeepSWE v1.1では、Gemini 4 Argonが77.9%を記録し、GPT-6 Astra・Claude Fable 5.1・Claude Opus 5.5を上回っています。
DeepSWE v1.1は、コーディングエージェントの力を測る評価です。コーディングエージェントとは、AIがコードを読み、修正し、テストの実行まで自分で進める使い方を指します。指示を受けて複数の手順を自分で計画し、道具を使いながら作業を進めるAIを、AIエージェントと呼びます。
短い仕様書から動くWebアプリを丸ごと作れるかを測るVibe Code Benchでも、Gemini 4 Argonは91.9%で1位でした。Google社内では、C/C++の大規模なプログラムを、安全なプログラムを書きやすい言語のRustへ移す作業にも使われています。
すべてのコーディングの評価で1位だったわけではありません。数時間から数十時間かかる非常に長い課題の評価FrontierSWE v2と、ターミナルでの作業の評価Terminal-bench 4.0では、Gemini 4 Argonの点数はGoogleの比較表の4モデルの中で最も低い結果でした。
ターミナルとは、文字でコマンドを入力してパソコンを操作する画面です。開発の中でも、課題の長さや作業の進め方によって結果が分かれています。
法務・金融などの知的作業で高い点数を出した
Gemini 4 Argonは、Googleの比較表にある知的作業の4つの評価すべてで1位になりました。知的作業の評価の結果は、以下の表のとおりです。
| 評価 | 何を測るか | Gemini 4 Argon | 他の3モデルの最高 |
|---|---|---|---|
| Vals Index | 金融・コーディング・法務・税務の作業を米国の経済規模で重み付けした総合指数 | 68.9% | 67.0%(Claude Opus 5.5) |
| AutomationBench | 業務の流れを最初から最後までこなせるか | 51.3% | 42.5%(Claude Opus 5.5) |
| Vals Finance Agent v2 | 複数の手順が続く金融の調査 | 65.4% | 58.9%(Claude Fable 5.1) |
| Harvey's Legal Agent Benchmark | 法律の調査と文書の作成 | 19.6% | 6.7%(Claude Fable 5.1) |
最も差が大きいのは法律の評価です。Harvey's Legal Agent Benchmarkで、Gemini 4 Argonの点数は2位のClaude Fable 5.1の約3倍でした。
法律の評価は、4モデルとも点数が20%未満にとどまっています。法律の仕事は、どのモデルにとってもまだ難しい課題です。
業務の自動化を測るAutomationBenchでも、Gemini 4 Argonは2位のClaude Opus 5.5を8.8ポイント上回りました。業務の流れを最初から最後までAIに任せたい会社にとって、関係の深い結果です。
サイバー防御で実際の脆弱性を見つける力が高い
脆弱性とは、プログラムの欠陥のうち、攻撃に悪用されるおそれのある弱点を指します。Gemini 4 Argonは、脆弱性を見つける評価で、サイバー防御向けに提供されてきたGemini 3.8 Flash Cyberを上回りました。2つのモデルの結果は、以下の表のとおりです。
| 評価 | 何を測るか | Gemini 4 Argon | Gemini 3.8 Flash Cyber |
|---|---|---|---|
| 実際の脆弱性の発見(Google社内の評価) | 設計図にあたるソースコードが公開されたソフトウェア(オープンソース)で最近確認された脆弱性をどれだけ見つけられるか | 85.8% | 71.0% |
| Wizのペネトレーションテスト | 実際のWebアプリの脆弱性を突くコードを、ソースコードを見ずに書けるか | 70.9% | 58.2% |
ペネトレーションテストとは、攻撃者と同じ手順でシステムへの侵入を試み、守りの弱い部分を確かめる検査です。Google社内の評価では、20のプログラミング言語にまたがる複雑なコードから、幅広い種類の脆弱性を見つけました。
セキュリティ企業のWizは、重要な公共インフラを無料で守る取り組みにGemini 4 Argonを使いました。世界中の病院で使われる医療ソフトから、個人情報が漏れる重大な脆弱性を見つけています。
脆弱性の修正を測るCWE-bench v1では、Gemini 4 Argonが68.0%でGPT-6 Astraと同率の1位でした。
長い資料・動画・専門的なグラフを読み取れる
Gemini 4 Argonは、長い入力や動画・グラフの理解でも、GPT-6 Astra・Claude Fable 5.1・Claude Opus 5.5を上回りました。長い資料や画像を扱う評価の結果は、以下の表のとおりです。
| 評価 | 何を測るか | Gemini 4 Argon | 2位のモデル |
|---|---|---|---|
| GraphWalks(25万6,000〜100万トークン) | 長い入力の中の情報を正しくたどれるか | 84.2% | 71.8%(GPT-6 Astra) |
| LVBench | 長い動画の理解 | 91.7% | 87.5%(GPT-6 Astra) |
| Chartography | 専門職が読むグラフの理解 | 71.6% | 71.0%(GPT-6 Astra) |
GraphWalksでは、入力が25万6,000〜100万トークンの長さで、Gemini 4 Argonが2位を12.4ポイント上回りました。入力が長くなるほど差が開いた結果です。
Chartographyは、生存率の曲線や株価のローソク足、流れの量を示すサンキー図など、専門的なグラフの読み取りを測ります。Gemini 4 Argonは、長い動画から細部を見つける作業や、一連の文書をもとに行動する作業にも向いています。
APIは、自社のアプリやシステムからAIを呼び出すための仕組みです。LVBenchの結果は、APIの制限で動画から読み込める画像の枚数がモデルごとに違う条件での値です。Gemini 4 Argonが入力できるデータの種類(画像・動画・音声など)の一覧は、2026年10月1日時点で公表されていません。
Gemini 4 Argonのベンチマーク結果(18項目の比較表)
ベンチマークとは、AIモデルの能力を同じ課題で測り、点数で比べるための評価です。Googleは、Gemini 4 ArgonをGPT-6 Astra・Claude Fable 5.1・Claude Opus 5.5の3モデルと18項目で比べた表を公表しました。比較表の結果は、以下の3つの観点で読み解けます。
- 18項目のうち12項目でGemini 4 Argonが単独1位
- Gemini 4 Argonが1位を逃した5項目と上回ったモデル
- ベンチマークの数値を読むときの4つの注意点
18項目のうち12項目でGemini 4 Argonが単独1位
Gemini 4 Argonは、比較表の18項目のうち12項目で単独1位となりました。残りの項目は、1項目がGPT-6 Astraと同率の1位で、5項目では他のモデルが1位になりました。比較表の全項目は、以下のとおりです。
| 分野 | 評価 | Gemini 4 Argon | GPT-6 Astra | Claude Fable 5.1 | Claude Opus 5.5 |
|---|---|---|---|---|---|
| 知的作業 | Vals Index | 68.9% | 63.1% | 65.8% | 67.0% |
| 知的作業 | AutomationBench | 51.3% | 41.4% | 31.4% | 42.5% |
| 知的作業 | Vals Finance Agent v2 | 65.4% | 53.5% | 58.9% | 58.6% |
| 知的作業 | Harvey's Legal Agent Benchmark | 19.6% | 5.4% | 6.7% | 3.8% |
| コーディング | DeepSWE v1.1 | 77.9% | 74.1% | 67.4% | 74.2% |
| コーディング | FrontierSWE v2 | 55.0% | 65.5% | 56.3% | 62.3% |
| コーディング | Vibe Code Bench | 91.9% | 89.6% | 90.3% | 90.3% |
| コーディング | Terminal-bench 4.0 | 57.4% | 58.2% | 57.9% | 66.4% |
| AIの開発 | PostTrainBench | 45.3% | 44.3% | 40.2% | 49.3% |
| 科学・数学 | Terminal-Bench Science 0.1 | 57.6% | 68.1% | 52.6% | 63.3% |
| 科学・数学 | LABBench 2 | 88.8% | 85.4% | 68.6% | 73.1% |
| 科学・数学 | RiemannBench | 76.0% | 72.0% | 65.6% | 69.6% |
| 長い入力 | GraphWalks(12万8,000トークン以下) | 99.7% | 98.7% | 91.4% | 90.6% |
| 長い入力 | GraphWalks(25万6,000〜100万トークン) | 84.2% | 71.8% | 65.0% | 66.8% |
| コンピューター操作 | Agent's Last Exam | 39.5% | 34.2% | — | 38.2% |
| コンピューター操作 | OSWorld-2.0 | 69.2% | 72.6% | — | — |
| 画像・動画の理解 | Chartography | 71.6% | 71.0% | 46.2% | 66.3% |
| 画像・動画の理解 | LVBench | 91.7% | 87.5% | 79.7% | 83.7% |
| サイバーセキュリティ | CWE-bench v1 | 68.0% | 68.0% | 58.0% | 67.0% |
表の「—」は、比較する値がない項目です。GraphWalksは入力の長さで2つの条件に分かれているため、表は19行ですが1項目として数えています。コンピューター操作とは、AIが画面を見ながらマウスとキーボードを動かし、人がパソコンでする作業を代わりに進める機能を指します。
Gemini 4 Argonが単独1位となった12項目を分野ごとに分けると、以下のとおりです。
- 知的作業: Vals Index・AutomationBench・Vals Finance Agent v2・Harvey's Legal Agent Benchmark
- コーディング: DeepSWE v1.1・Vibe Code Bench
- 科学・数学: LABBench 2・RiemannBench
- 長い入力: GraphWalks
- コンピューター操作: Agent's Last Exam
- 画像・動画の理解: Chartography・LVBench
LABBench 2は生物学の研究作業、RiemannBenchは研究者が出会った博士レベルの数学の難問を題材にした評価です。Agent's Last Examは、13の業界で経済的な価値のある長時間の作業を、コンピューター操作でこなせるかを測ります。
Gemini 4 Argonが1位を逃した5項目と上回ったモデル
Gemini 4 Argonは、18項目のうち5項目で1位を逃しました。5項目で1位になったモデルと、Gemini 4 Argonの順位は、以下の表のとおりです。
| 評価 | 何を測るか | 1位のモデルと点数 | Gemini 4 Argonの点数と順位 |
|---|---|---|---|
| FrontierSWE v2 | 数時間から数十時間かかる非常に長いコーディング課題 | GPT-6 Astra 65.5% | 55.0%(4モデル中4位) |
| Terminal-bench 4.0 | ターミナルでのエージェントの作業 | Claude Opus 5.5 66.4% | 57.4%(4モデル中4位) |
| PostTrainBench | 限られた計算資源でAIモデルを追加学習して性能を上げる | Claude Opus 5.5 49.3% | 45.3%(4モデル中2位) |
| Terminal-Bench Science 0.1 | ターミナルでの科学計算や研究の作業 | GPT-6 Astra 68.1% | 57.6%(4モデル中3位) |
| OSWorld-2.0 | 画面を見ながらのコンピューター操作 | GPT-6 Astra 72.6% | 69.2%(2モデル中2位) |
GPT-6 Astraが3項目、Claude Opus 5.5が2項目で1位になりました。1位との差が大きいのはFrontierSWE v2とTerminal-Bench Science 0.1で、どちらも10.5ポイントの差がついています。
FrontierSWE v2・PostTrainBenchは長い時間をかけて進める作業、Terminal-bench 4.0・Terminal-Bench Science 0.1はターミナルで操作する作業の評価です。PostTrainBenchは、1枚の計算用の装置(GPU)と10時間の制限の中で、AIモデルの性能をどこまで高められるかを測ります。
長時間の開発やターミナルでの作業を任せる予定があるなら、Gemini 4 Argonだけで決めず、各項目で1位のモデルとも比べる必要があります。
ベンチマークの数値を読むときの4つの注意点
比較表の数字は、測った組織や条件がすべてそろっているわけではありません。比較表を読むときに押さえたい注意点は、以下の4つです。
- 他社モデルの点数は各社の公表値や公式ランキングの値が中心
- Gemini 4 Argonの点数にはGoogleが自分で測った値が多い
- 原則として最も高い推論レベルの値で比べている
- 空欄の項目や条件の違う項目がある
他社の3モデルの点数は、特に断りがない限り、各社の公表値や評価の運営団体が出す公式ランキングの値を使っています。4モデルすべてをGoogleが測ったのは、PostTrainBench・LABBench 2・GraphWalks・LVBenchの4つです。
Gemini 4 Argonの点数は、DeepSWE v1.1・Terminal-bench 4.0・Terminal-Bench Science 0.1・OSWorld-2.0などでGoogleが自分で測りました。Terminal-Bench Science 0.1のGemini 4 Argonの値は検証の制限時間を6倍に延ばして測ったもので、他の3モデルは公式ランキングの値です。OSWorld-2.0では、3回実行した中で最も高い結果が載っています。
推論レベルとは、AIが回答の前に考える量の設定を指します。Gemini 4 ArgonはGemini APIで最も高い推論レベルで測られました。他社のモデルは原則として最も高い推論レベルの値で、公表値がない場合は公表されている中で最も点の高い推論レベルの値が使われています。
Claude Fable 5.1は、Agent's Last ExamとOSWorld-2.0の2項目が空欄です。Agent's Last Examは公式のランキングにClaude Fable 5.1の値がなく、OSWorld-2.0はAnthropicが条件の違う合計値しか公表していないためです。
ChartographyはGoogleの比較表ではツールを使わない条件の値で、Anthropicが公表したツールありの条件では、Claude Opus 5.5は89.0%でした。Agent's Last Examも、比較表は課題に合格したかどうかの割合で、OpenAIが公表したGPT-6 Astraの59.3%とは指標が異なります。
ベンチマークの点数は、実際の仕事での成功率をそのまま示す数字ではありません。
Gemini 4 Argonと5つのモデルの比較一覧
Gemini 4 Argonを検討するときは、性能だけでなく料金や使える場所も他のモデルと比べる必要があります。Googleの比較表に載っているのはGPT-6 Astra・Claude Fable 5.1・Claude Opus 5.5の3モデルだけで、GPT-6.1 SolとGemini 3.1 Proは載っていません。以下の一覧は、6つのモデルについて各社が公式に公表した値を並べたもので、比べる観点は次の2つです。
- 料金・コンテキストウィンドウ・最大出力の比較
- 使える場所と無料で使えるかの比較
料金・コンテキストウィンドウ・最大出力の比較
コンテキストウィンドウとは、AIが1回の処理で読み込める情報量の上限です。導入価格は、提供を始めた当初に割安に設定される料金を指します。6モデルのAPI料金と扱える量は、以下の表のとおりです(料金は100万トークンあたり、2026年10月1日時点)。
| モデル | 提供元 | 入力 | 出力 | コンテキストウィンドウ | 最大出力 |
|---|---|---|---|---|---|
| Gemini 4 Argon | 2ドル(導入価格) | 10ドル(導入価格) | 公表されていない | 100万トークン | |
| GPT-6 Astra | OpenAI | 10ドル | 50ドル | 105万トークン | 12万8,000トークン |
| GPT-6.1 Sol | OpenAI | 2ドル | 10ドル | 105万トークン | 12万8,000トークン |
| Claude Fable 5.1 | Anthropic | 10ドル | 50ドル | 100万トークン | 12万8,000トークン |
| Claude Opus 5.5 | Anthropic | 4ドル | 20ドル | 100万トークン | 12万8,000トークン |
| Gemini 3.1 Pro | 2ドル | 12ドル | 1,048,576トークン | 65,536トークン |
Gemini 4 Argonの導入価格は、GPT-6.1 Solと同じ単価で、GPT-6 AstraとClaude Fable 5.1の5分の1です。導入期間の後は、入力4ドル・出力20ドルに上がります。
表の料金と上限には、以下の補足があります。
- GPT-6 AstraとGPT-6.1 Solの入力は最大92万2,000トークン
- Gemini 3.1 Proの料金は入力が20万トークン以下の場合で、超えると入力4ドル・出力18ドル
- Claude Opus 5.5はBatch API(まとめて処理する代わりに料金が下がる方式)でベータ機能を使う場合に最大30万トークンまで出力できる
使える場所と無料で使えるかの比較
6モデルは、使えるサービスとプランも大きく違います。主に使える場所と無料版での扱いは、以下の表のとおりです(2026年10月1日時点)。
| モデル | 主に使える場所 | 無料版で使えるか |
|---|---|---|
| Gemini 4 Argon | Fairwindプログラムの参加組織とGoogle社内のみ | 公表されていない |
| GPT-6 Astra | ChatGPT(Plus・Pro・Business・Enterprise)、OpenAI API | 使えない |
| GPT-6.1 Sol | ChatGPTのWorkとCodex(Plus・Pro・Business・Enterprise・Edu)、OpenAI API | 使えない |
| Claude Fable 5.1 | Claudeのアプリ・Claude Code・Cowork、Claude API | 使えない |
| Claude Opus 5.5 | Claudeのアプリ・Claude Code・Cowork(Pro・Max・Team・Enterprise)、Claude API | 使えない |
| Gemini 3.1 Pro | Geminiアプリ・NotebookLM・Google AI Studio・Vertex AI・Gemini CLI・Antigravity | Geminiアプリの無料版で制限付きで使える |
6モデルの中で、無料で使えることが確認できるのはGemini 3.1 Proだけです。
CodexとClaude Codeは、AIにコードの作成や修正を任せる開発支援の道具を指します。ChatGPTのWorkを使うと、複数の手順が続く仕事を完成まで進められます。Google AI StudioとVertex AIは、開発者や企業がGeminiのモデルを使うための環境です。
プランごとの扱いにも違いがあります。PlusプランのGPT-6 Astraは、ChatGPTのWorkとCodexで使える量が限られています。GPT-6.1 Solは、通常のChatでは選べません。Claude Fable 5.1は、Proプランでは利用枠に含まれず、使用クレジットでのみ使えます。
Gemini 4 ArgonとGPT-6 Astra・GPT-6.1 Solの比較
OpenAIのGPT-6 Astraは、Googleの比較表で1位を取った項目がGemini 4 Argonに次いで多いモデルです。GPT-6.1 Solは比較表に載っていないため、参考となる値と料金・仕様で比べます。OpenAIの2モデルとの違いは、以下の5つです。
- 知的作業と2つのコーディングの評価はGemini 4 ArgonがGPT-6 Astraを上回る
- 長時間のコーディング・ターミナル作業・OSWorld-2.0はGPT-6 Astraが上回る
- 長い資料・動画・研究の評価でもGemini 4 ArgonがGPT-6 Astraを上回る
- GPT-6.1 Solとは同じ条件で比べた評価がない
- 料金はGPT-6 Astraの5分の1でGPT-6.1 Solと同じ水準
知的作業と2つのコーディングの評価はGemini 4 ArgonがGPT-6 Astraを上回る
Gemini 4 Argonは、Googleの比較表の18項目のうち13項目でGPT-6 Astraの点数を上回りました。GPT-6 Astraを上回った知的作業とコーディングの項目は、以下の表のとおりです。
| 評価 | Gemini 4 Argon | GPT-6 Astra | 差 |
|---|---|---|---|
| Vals Index | 68.9% | 63.1% | 5.8ポイント |
| AutomationBench | 51.3% | 41.4% | 9.9ポイント |
| Vals Finance Agent v2 | 65.4% | 53.5% | 11.9ポイント |
| Harvey's Legal Agent Benchmark | 19.6% | 5.4% | 14.2ポイント |
| DeepSWE v1.1 | 77.9% | 74.1% | 3.8ポイント |
| Vibe Code Bench | 91.9% | 89.6% | 2.3ポイント |
法律の評価では、Gemini 4 Argonの点数がGPT-6 Astraの3倍を超えました。金融の調査と業務の自動化でも、10ポイント前後の差がついています。
コーディングでは、長い開発の課題を解くDeepSWE v1.1と、仕様書からWebアプリを作るVibe Code Benchの2つでGemini 4 Argonが上回りました。差は2〜4ポイントほどで、知的作業ほどの開きはありません。コーディングの残りの2項目は、GPT-6 Astraが上回っています。
長時間のコーディング・ターミナル作業・OSWorld-2.0はGPT-6 Astraが上回る
GPT-6 Astraは、Googleの比較表の4項目でGemini 4 Argonを上回りました。GPT-6 Astraが上回った項目は、以下の表のとおりです。
| 評価 | 何を測るか | GPT-6 Astra | Gemini 4 Argon |
|---|---|---|---|
| FrontierSWE v2 | 非常に長いコーディング課題 | 65.5% | 55.0% |
| Terminal-bench 4.0 | ターミナルでのエージェントの作業 | 58.2% | 57.4% |
| Terminal-Bench Science 0.1 | ターミナルでの科学研究の作業 | 68.1% | 57.6% |
| OSWorld-2.0 | 画面を見ながらのコンピューター操作 | 72.6% | 69.2% |
Terminal-bench 4.0の差は0.8ポイントで、ほぼ同じ水準です。FrontierSWE v2とTerminal-Bench Science 0.1では、GPT-6 Astraが10ポイント以上の差をつけました。
コンピューター操作のもう1つの評価Agent's Last Examでは、Gemini 4 Argonが39.5%で、GPT-6 Astraの34.2%を上回っています。コンピューター操作の2つの評価で、結果が分かれた形です。
何時間も続く開発や科学研究の作業をAIに任せるなら、GPT-6 Astraは引き続き有力な候補になります。
長い資料・動画・研究の評価でもGemini 4 ArgonがGPT-6 Astraを上回る
Gemini 4 Argonは、長い入力・動画・グラフの理解と研究の評価でも、GPT-6 Astraより高い点数を出しました。主な項目の結果は、以下の表のとおりです。
| 評価 | 何を測るか | Gemini 4 Argon | GPT-6 Astra |
|---|---|---|---|
| GraphWalks(12万8,000トークン以下) | 長い入力の中の情報をたどる | 99.7% | 98.7% |
| GraphWalks(25万6,000〜100万トークン) | さらに長い入力の中の情報をたどる | 84.2% | 71.8% |
| LVBench | 長い動画の理解 | 91.7% | 87.5% |
| Chartography | 専門的なグラフの理解 | 71.6% | 71.0% |
| LABBench 2 | 生物学の研究作業 | 88.8% | 85.4% |
| RiemannBench | 博士レベルの数学の難問 | 76.0% | 72.0% |
| PostTrainBench | AIモデルの追加学習 | 45.3% | 44.3% |
入力が長くなるほど、2つのモデルの差は開きました。12万8,000トークン以下では1.0ポイント差でしたが、25万6,000〜100万トークンでは12.4ポイント差です。
ChartographyとPostTrainBenchの差は1ポイント以下で、2つのモデルはほぼ互角です。脆弱性の修正を測るCWE-bench v1では、どちらも68.0%で同率でした。
GPT-6.1 Solとは同じ条件で比べた評価がない
GPT-6.1 Solは、Googleの比較表に載っていません。OpenAIがGPT-6.1 Solの発表で公表した評価のうち、Gemini 4 Argonの比較表と同じ名前の評価は4つあります。参考として並べると、以下の表のとおりです。
| 評価 | Gemini 4 Argon | GPT-6.1 Sol | 条件の違い |
|---|---|---|---|
| DeepSWE v1.1 | 77.9% | 75.2%(推論レベルhigh) | Gemini 4 ArgonはGoogleが自分で測った値 |
| AutomationBench | 51.3% | 36.1%(推論レベルmax) | Gemini 4 ArgonはZapierの公式ランキングの値 |
| Terminal-Bench Science 0.1 | 57.6% | 57.0%(推論レベルmax) | Gemini 4 Argonは検証の制限時間を6倍に延ばして測定 |
| OSWorld-2.0(オフライン・部分点) | 69.2% | 71.4%(推論レベルmax) | Gemini 4 Argonは3回実行した中の最大値 |
GPT-6.1 Solの値は、推論レベルごとの結果のうち最も高いものを載せています。4つのうち3つはGemini 4 Argonの点数が高く、OSWorld-2.0だけGPT-6.1 Solが上回りました。
測った組織や条件が違うため、表の差をそのまま性能の差として読むことはできません。GPT-6.1 Solは、GPT-6 Astraに迫る性能をAstraの5分の1の料金で使えるモデルです。
GPT-6.1 Solとは?料金・性能・使い方とAstraとの違いを徹底解説
料金はGPT-6 Astraの5分の1でGPT-6.1 Solと同じ水準
Gemini 4 Argonの導入価格は、100万トークンあたり入力2ドル・出力10ドルです。GPT-6 Astraの入力10ドル・出力50ドルの5分の1で、GPT-6.1 Solと同じ単価になります。
導入期間の後は入力4ドル・出力20ドルで、GPT-6.1 Solの2倍の単価です。
GPT-6 AstraとGPT-6.1 Solは、入力が27万2,000トークンを超えると入力の料金が2倍、出力の料金が1.5倍になります。Gemini 4 Argonは、長い入力での割増しの有無が公表されていません。
長い成果物を1回で出力させたい用途では、Gemini 4 Argonの100万トークンが有利に働きます。今すぐ仕事に使えるかどうかでは、ChatGPTとOpenAI APIで使えるGPT-6 AstraとGPT-6.1 Solに分があります。
Gemini 4 ArgonとClaude Fable 5.1・Claude Opus 5.5の比較
AnthropicのClaude Fable 5.1とClaude Opus 5.5は、Googleの比較表に載った2つのClaudeのモデルです。Claudeの2モデルとの比較は、以下の3つの観点で整理できます。
- Claude Fable 5.1には18項目のうち14項目でGemini 4 Argonが上回る
- Claude Opus 5.5がGemini 4 Argonを上回った4項目
- Claude Fable 5.1とClaude Opus 5.5の関係と料金の差
Claude Fable 5.1には18項目のうち14項目でGemini 4 Argonが上回る
Gemini 4 Argonは、Googleの比較表の18項目のうち14項目でClaude Fable 5.1の点数を上回りました。Claude Fable 5.1が上回ったのはFrontierSWE v2とTerminal-bench 4.0の2項目で、残りの2項目はClaude Fable 5.1の値が空欄です。
差が10ポイント以上開いた項目は、以下の表のとおりです。
| 評価 | Gemini 4 Argon | Claude Fable 5.1 | 差 |
|---|---|---|---|
| Chartography | 71.6% | 46.2% | 25.4ポイント |
| LABBench 2 | 88.8% | 68.6% | 20.2ポイント |
| AutomationBench | 51.3% | 31.4% | 19.9ポイント |
| GraphWalks(25万6,000〜100万トークン) | 84.2% | 65.0% | 19.2ポイント |
| Harvey's Legal Agent Benchmark | 19.6% | 6.7% | 12.9ポイント |
| LVBench | 91.7% | 79.7% | 12.0ポイント |
| DeepSWE v1.1 | 77.9% | 67.4% | 10.5ポイント |
| RiemannBench | 76.0% | 65.6% | 10.4ポイント |
| CWE-bench v1 | 68.0% | 58.0% | 10.0ポイント |
最も差の大きいChartographyの値は、ツールを使わない条件で測られました。Anthropicが公表したツールありの条件では、Claude Fable 5.1は88.4%を記録しています。LVBenchでも、Claude Fable 5.1はAPIの制限で動画から300枚の画像しか読み込めない条件で測られました。
Claude Fable 5.1とClaude Opus 5.5には、安全のための判定で依頼を断ったときに、別のモデルへ切り替えて再実行する仕組み(フォールバック)があります。OpenAIはGPT-6.1 Solの発表で、AutomationBenchのClaude Fable 5.1の値について、約40%の課題でフォールバックが起きたと注記しました。Claude Opus 5.5のAutomationBenchとTerminal-Bench Science 0.1の値も、OpenAIの発表ではフォールバックありの条件の値と一致します。これらの項目では、Claudeの点数に別のモデルが答えた分が含まれている可能性がある点に注意が必要です。
Claude Fable 5.1とは?料金・性能をFable 5と16課題で比較
Claude Opus 5.5がGemini 4 Argonを上回った4項目
Claude Opus 5.5は、Googleの比較表のTerminal-bench 4.0とPostTrainBenchの2項目で1位になりました。FrontierSWE v2とTerminal-Bench Science 0.1でも、1位ではないもののGemini 4 Argonの点数を上回っています。4項目の結果は、以下の表のとおりです。
| 評価 | 何を測るか | Claude Opus 5.5 | Gemini 4 Argon |
|---|---|---|---|
| Terminal-bench 4.0 | ターミナルでのエージェントの作業 | 66.4%(1位) | 57.4% |
| PostTrainBench | AIモデルの追加学習 | 49.3%(1位) | 45.3% |
| FrontierSWE v2 | 非常に長いコーディング課題 | 62.3% | 55.0% |
| Terminal-Bench Science 0.1 | ターミナルでの科学研究の作業 | 63.3% | 57.6% |
Terminal-bench 4.0で、Claude Opus 5.5は2位のGPT-6 Astraを8.2ポイント上回りました。Terminal-bench 4.0では、Claude Opus 5.5の点数が4モデルの中で飛び抜けています。
Terminal-Bench Science 0.1の63.3%は公式ランキングの値で、Anthropicの発表ではClaude Opus 5.5の点数は58.7%でした。同じ評価でも、どこで測った値かによって数字が変わります。
4項目以外では、値が空欄のOSWorld-2.0を除く13項目で、Gemini 4 ArgonがClaude Opus 5.5を上回りました。法律の評価ではGemini 4 Argonの19.6%に対してClaude Opus 5.5は3.8%で、知的作業の差が目立ちます。
Claude Fable 5.1とClaude Opus 5.5の関係と料金の差
Claude Fable 5.1は、一般に提供されているClaudeの中で最上位のモデルです。Claude Opus 5.5は2026年9月22日に発表されたモデルで、ほとんどの仕事でClaude Fable 5.1の水準の性能を出します。
Claudeのモデル選びは、Claude Opus 5.5から始め、高い推論レベルでも足りない仕事だけClaude Fable 5.1に切り替えるのが基本です。Googleの比較表でも、Claude Opus 5.5は多くの項目でClaude Fable 5.1を上回りました。Claude Fable 5.1が上回ったのは、以下の3つだけです(Vibe Code Benchは同点)。
- Vals Finance Agent v2
- Harvey's Legal Agent Benchmark
- GraphWalks(12万8,000トークン以下の条件)
API料金は、Claude Fable 5.1が100万トークンあたり入力10ドル・出力50ドル、Claude Opus 5.5が入力4ドル・出力20ドルです。Claude Fable 5.1の単価は、Claude Opus 5.5の2.5倍にあたります。
Gemini 4 Argonの導入価格はClaude Opus 5.5の半額で、導入期間が終わるとClaude Opus 5.5と同じ単価になります。ClaudeのAPIには、長い入力での料金の割増しがありません。
Gemini 4 ArgonとGemini 3.1 Proの違い(Gemini 3と4の違い)
Gemini 3.1 Proは、Gemini 3の世代の上位モデルです。Gemini 3と4の世代の違いを、Gemini 3.1 ProとGemini 4 Argonで比べると、以下の4つにまとまります。
- 出力の上限が65,536トークンから100万トークンに広がった
- 導入価格なら入力が同じで出力はGemini 4 Argonが安い
- Gemini 3.1 Proは無料版のGeminiアプリで使えるがGemini 4 Argonは提供前
- 同じ評価で比べた点数はまだ公表されていない
出力の上限が65,536トークンから100万トークンに広がった
Gemini 4 Argonで大きく変わったのは出力の上限です。Gemini 3.1 ProとGemini 4 Argonの主な仕様は、以下の表のとおりです。
| 項目 | Gemini 3.1 Pro | Gemini 4 Argon |
|---|---|---|
| 発表日 | 2026年2月19日 | 2026年9月30日 |
| 提供の状態 | プレビュー版で提供中 | Fairwindプログラムの参加組織とGoogle社内のみ |
| 入力の上限 | 1,048,576トークン | 公表されていない |
| 出力の上限 | 65,536トークン | 100万トークン |
| 入力できるもの | テキスト・画像・動画・音声・PDF | 一覧は公表されていない |
| APIのモデル名 | gemini-3.1-pro-preview | 公表されていない |
プレビュー版とは、正式版の前に機能を試してもらうために提供される版を指します。Gemini 3.1 Proは、2026年10月1日時点でもプレビュー版の表記です。
入力の上限はGemini 4 Argonでは公表されていないため、読み込める資料の量の違いはまだ比べられません。一部の報道にはGemini 4 Argonの入力の上限を100万トークンとする記述がありますが、Googleが100万トークンと公表したのは出力の上限です。
導入価格なら入力が同じで出力はGemini 4 Argonが安い
Gemini 4 Argonの導入価格は、Gemini 3.1 Pro(入力20万トークン以下)と入力の単価が同じで、出力の単価が低く設定されています。2つのモデルのAPI料金は、以下の表のとおりです(100万トークンあたり)。
| 料金の種類 | Gemini 3.1 Pro | Gemini 4 Argon(導入価格) |
|---|---|---|
| 入力 | 2ドル(20万トークン以下)、4ドル(20万トークン超) | 2ドル |
| 出力 | 12ドル(20万トークン以下)、18ドル(20万トークン超) | 10ドル |
| キャッシュ済み入力 | 0.20ドル(20万トークン以下) | 入力料金の95%引き |
| Batch | 入力1ドル・出力6ドル | 公表されていない |
入力が20万トークン以下なら、出力の単価はGemini 4 Argonの方が2ドル安くなります。導入期間の後は入力4ドル・出力20ドルに上がるため、Gemini 3.1 Proより高い単価に変わります。
Gemini APIでGemini 3.1 Proを使う場合、無料枠はありません。
Gemini 3.1 Proは無料版のGeminiアプリで使えるがGemini 4 Argonは提供前
Gemini 3.1 Proは、Geminiアプリの無料版でも制限付きで使えます。日本のGeminiアプリのプランと、Gemini 3.1 Proの扱いは以下の表のとおりです(2026年10月1日時点)。
| プラン | 月額料金 | Gemini 3.1 Proの扱い |
|---|---|---|
| 無料 | 0円 | 制限付きで使える |
| Google AI Plus | 725円 | 無料版の2倍の上限 |
| Google AI Pro | 2,900円 | 無料版の4倍の上限 |
| Google AI Ultra | 14,500円または32,000円 | Google AI Proの5倍または20倍の上限 |
Gemini 4 Argonは、2026年10月1日時点でGeminiアプリでは使えません。Geminiアプリの無料版や、月2,900円のGoogle AI ProでGemini 4 Argonを使えるようになるかは未発表です。
同じ評価で比べた点数はまだ公表されていない
Googleの比較表にGemini 3.1 Proは載っておらず、Gemini 4 Argonと同じ評価で比べた点数はありません。Gemini 3.1 Proの公式の評価は2026年2月時点のもので、比較相手もClaude Opus 4.6やGPT-5.2の世代です。
Gemini 3.1 Proの主な公式の評価は、以下の表のとおりです。
| 評価 | Gemini 3.1 Pro | 何を測るか |
|---|---|---|
| SWE-Bench Verified | 80.6% | 実際のソフトウェアの不具合の修正 |
| ARC-AGI-2 | 77.1% | 初めて見るパズルを解く推論の力 |
| GPQA Diamond | 94.3% | 大学院レベルの科学の問題 |
| Terminal-Bench 2.0 | 68.5% | ターミナルでのエージェントの作業 |
Terminal-Bench 2.0は、Gemini 4 Argonの比較表にあるTerminal-bench 4.0とは版が違うため、点数を比べられません。Gemini 3.1 ProからGemini 4 Argonへ切り替える価値は、公開後に自社の仕事で両方を試して確かめるのが確実です。
Gemini 4 Argonの料金
Gemini 4 Argonの料金は、APIで使う場合の単価だけが公表されています。導入期間の長さなど、決まっていない項目も多く残っています。料金について押さえたい点は、以下の3つです。
- 導入価格は入力2ドル・出力10ドルで導入期間の後は2倍になる
- 公表されていない料金の項目がある
- キャッシュと長い入力の割増しを含めた他のモデルとの料金比較
導入価格は入力2ドル・出力10ドルで導入期間の後は2倍になる
Gemini 4 ArgonのAPI料金は、導入価格と導入期間の後の2段階で公表されています。料金の内訳は、以下の表のとおりです(100万トークンあたり)。
| 料金の種類 | 導入価格 | 導入期間の後 |
|---|---|---|
| 入力 | 2ドル | 4ドル |
| 出力 | 10ドル | 20ドル |
| キャッシュ済み入力 | 入力料金の95%引き | 公表されていない |
導入期間が終わると、入力と出力の単価はどちらも2倍になります。
導入価格のキャッシュ済み入力は、入力料金の95%引きです。100万トークンあたりでは0.10ドルに相当します。
キャッシュ済み入力とは、前のリクエストで送った内容を再利用するときの割引料金です。AIエージェントは同じ指示や資料を何度も読み込むため、キャッシュの割引が大きいほど、長い作業を続けたときの費用を抑えられます。
公表されていない料金の項目がある
Gemini 4 Argonの料金には、2026年10月1日時点で公表されていない項目があります。未公表の主な項目は、以下のとおりです。
- 導入価格が続く期間と終了日
- 長い入力での料金の割増しの有無
- Batchなど処理方式ごとの料金
- キャッシュの保存料金
- Google AI Ultraなどの月額プランでの扱い
Gemini APIの料金ページには、2026年10月1日時点でGemini 4 Argonが載っていません。導入期間の終わりが決まっていないため、導入価格を前提にシステムの費用を見積もると、後で費用が2倍になるおそれがあります。
長期の費用を見積もるときは、導入期間の後の入力4ドル・出力20ドルで計算しておくと安全です。
キャッシュと長い入力の割増しを含めた他のモデルとの料金比較
API料金は、入力と出力の単価だけでなく、キャッシュの料金と長い入力での割増しでも差が出ます。入力と出力の単価以外の6モデルの料金の条件は、以下の表のとおりです(100万トークンあたり)。
| モデル | キャッシュ済み入力 | 長い入力での割増し |
|---|---|---|
| Gemini 4 Argon(導入価格) | 0.10ドル相当 | 公表されていない |
| GPT-6 Astra | 1ドル | 27万2,000トークン超で入力2倍・出力1.5倍 |
| GPT-6.1 Sol | 0.10ドル | 27万2,000トークン超で入力2倍・出力1.5倍 |
| Claude Fable 5.1 | 0.25ドル | なし |
| Claude Opus 5.5 | 0.20ドル | なし |
| Gemini 3.1 Pro | 0.20ドル | 20万トークン超で入力4ドル・出力18ドル |
数十万トークンの資料を毎回読み込ませる使い方では、割増しの有無で費用が大きく変わります。Gemini 4 Argonの割増しの条件は、公開後に料金ページで確認が必要です。Batchは、急ぎでない大量の処理をまとめて受け付ける代わりに料金を下げる方式です。
1つの仕事を終えるまでの費用は、単価に使ったトークンの量をかけて決まります。公開後にAPIの費用を見積もるときは、実際の依頼を数件試し、使ったトークンの量を記録してから計算しましょう。
Gemini 4 Argonはいつから使える?提供状況と今後の予定
Gemini 4 Argonは、発表の時点で一般には公開されていません。能力が高いため、安全に公開できるよう段階的に提供範囲を広げる方針がとられています。提供の状況は、以下の4つに分けて確認します。
- 最初の提供はFairwindプログラムの参加組織とGoogle社内
- 次は有料APIの利用者とGoogle AI Ultraの契約者
- 日本での提供・無料版・Geminiアプリでの提供は公表されていない
- 一般公開の前に米国政府の事前アクセスの手続きに参加している
最初の提供はFairwindプログラムの参加組織とGoogle社内
Fairwindプログラムは2026年9月2日に始まり、世界で650以上の組織が参加しています。
Fairwindプログラムの主な対象は、以下のとおりです。
- 政府や国のサイバー当局
- 医療・通信・エネルギー・金融などの重要インフラの事業者
- 基盤となる技術のプラットフォームの事業者
- Google Cloudの顧客とサイバーセキュリティのパートナー
- 防御のための評価を重視する学術機関
参加組織の中でも、Gemini 4 Argonを使えるのはサイバーセキュリティ・インシデント対応・ペネトレーションテストを担当するチームに限られます。インシデント対応とは、サイバー攻撃などの事故が起きたときの調査と復旧の対応を指します。
利用者ごとの認証と、フィッシングに強い多要素認証が参加の条件です。利用の権利を共有したり、販売したりすることはできません。
参加を希望する組織は、Fairwindプログラムの関心表明のフォームから申し込めます。日本の組織が参加できるかどうかは、2026年10月1日時点で記載されていません。
次は有料APIの利用者とGoogle AI Ultraの契約者
Googleは、Gemini 4 Argonの提供先を段階的に広げる予定です。発表で示された提供の順番は、以下のとおりです。
- Fairwindプログラムの参加組織とGoogle社内(提供中)
- 有料のGemini APIの利用者とGoogle AI Ultraの契約者
- 開発者・企業・一般の利用者
2番目と3番目の段階について、具体的な日付は2026年10月1日時点で公表されていません。Google AI Ultraは、Geminiアプリの最上位の有料プランで、日本では月14,500円から契約できます。
APIで使いたい企業は、Gemini APIのモデル一覧にGemini 4 Argonが追加されるかを確認すると、提供の開始に気づけます。
日本での提供・無料版・Geminiアプリでの提供は公表されていない
Gemini 4 Argonの提供について、2026年10月1日時点で決まっていない項目は多く残っています。公表されていない主な項目は、以下の表のとおりです。
| 項目 | 2026年10月1日時点の状況 |
|---|---|
| 日本での提供 | 公表されていない |
| 日本語の性能 | 公表されていない |
| 無料版での提供 | 公表されていない |
| Geminiアプリ(無料版・Google AI Pro)での提供 | 名前を挙げた発表はない |
| Google AI Studio・Vertex AI・Gemini CLI・Antigravity・Google Workspace | 発表で触れられていない |
| APIのモデル名 | 公表されていない |
発表で次の提供先に挙がっているのは、有料のAPIとGoogle AI Ultraだけです。
一般公開の前に米国政府の事前アクセスの手続きに参加している
Googleは、Gemini 4 Argonを広く公開する前に、米国政府が任意で行う事前アクセスの手続きに参加しています。
Googleは、初期の利用者の意見を聞きながらガードレールを改善し、段階的に提供を広げる方針を示しました。ガードレールとは、AIが危険な依頼に応じないようにする安全のための仕組みを指します。
政府の手続きに参加しながら段階的に提供を広げる方針のため、一般公開の時期は発表だけでは読めません。
Gemini 4 Argonの安全性と使う前の注意点
Gemini 4 Argonは、サイバー防御の能力が高い分、悪用を防ぐ仕組みにも力が入れられています。安全面で知っておきたい点と使う前の準備は、以下の4つです。
- ガードレールなしの提供は審査済みの防御組織とGoogle社内に限られる
- 悪用を防ぐ仕組みと思考の過程の監視
- 間接プロンプトインジェクションへの耐性は比較したモデルで最も高い
- 会社で使う前に社内ルールとデータの扱いを決める
ガードレールなしの提供は審査済みの防御組織とGoogle社内に限られる
Googleは、Fairwindプログラムの審査済みの防御組織とGoogle社内のチームに、サイバー用のガードレールを外したGemini 4 Argonを提供しています。防御する側が、Gemini 4 Argonのサイバー防御の能力をすべて使えるようにするための措置です。
Fairwindプログラムで認められている用途は、防御と学術研究のための許可された脅威シミュレーション・リバースエンジニアリング・マルウェア解析です。リバースエンジニアリングとは、完成したソフトウェアを分析して仕組みを調べることを指します。マルウェアは、コンピューターに害を与える目的で作られた不正なプログラムです。
Fairwindプログラムは、新しい脅威が広がる前に、防御する側に先に能力を渡して備えてもらうことを目的にしています。
一般の利用者に提供されるGemini 4 Argonは、サイバー攻撃や化学・生物・放射性物質・核の兵器につながる依頼を断るように設計されています。ガードレールなしで使えるのは、審査を通った組織とGoogle社内だけです。
悪用を防ぐ仕組みと思考の過程の監視
Gemini 4 Argonには、悪用を防ぐための複数の対策が組み込まれています。Googleが示したGemini 4 Argonの安全対策は、以下の4つです。
- 危険な依頼を断りつつ、正当な科学研究は妨げない
- 間接プロンプトインジェクションへの耐性を高める
- 思考の過程と行動を監視し、必要なら実行を止める
- 危険度の高い学習や評価の前に、隔離した環境を用意する
危険な依頼を断る判断は、フロンティア安全フレームワークに沿って行われます。フロンティア安全フレームワークは、AIの危険な能力を評価し、能力に応じた安全対策を決めるGoogle DeepMindの枠組みです。
Gemini 4 Argonの思考の過程と行動を監視し、必要なら実行を止める仕組みも導入されています。悪用を見つけるために、モデル内部の動きを監視する技術も改良されました。社内外の専門チームが攻撃役となって、安全策の頑健さを手動と自動の両方で試しています。
Gemini 4 Argonのモデルカードと、フロンティア安全フレームワークでの判定結果は、2026年10月1日時点で公開されていません。モデルカードとは、モデルの性能・制限・安全の評価をまとめた公式の資料です。
間接プロンプトインジェクションへの耐性は比較したモデルで最も高い
プロンプトインジェクションとは、AIへの指示に悪意のある命令を紛れ込ませ、AIに意図しない動作をさせる攻撃です。間接プロンプトインジェクションは、AIが読み込むWebページやメールの中に命令を仕込む手口を指します。
Gemini 4 Argonは、Gray Swanの間接プロンプトインジェクションの評価で、攻撃の成功率が最も低い結果を出しました。主なモデルの結果は、以下の表のとおりです。
| モデル | 攻撃の成功率(低いほど安全) |
|---|---|
| Gemini 4 Argon | 0.7% |
| Claude Opus 5.5 | 1.0% |
| Claude Fable 5.1 | 1.0% |
| GPT-6 Astra | 8.5% |
| GPT-6 Sol | 10.1% |
表の値は、1つの攻撃を15回試したときの攻撃の成功率を示します。GPT-6 Solは、GPT-6.1 Solの前の版にあたるモデルです。GPT-6.1 SolとGemini 3.1 Proは、Googleが公表したグラフに載っていません。
AIエージェントにメールやWebページを読ませる仕事では、プロンプトインジェクションへの耐性が安全性に直結します。成功率は0%ではないため、送信や削除のような重要な操作の前に人が確認する仕組みは欠かせません。
AIエージェントのセキュリティを徹底解説!10のリスクと企業の対策も紹介
会社で使う前に社内ルールとデータの扱いを決める
Gemini 4 Argonが使えるようになる前に、業務でAIを使うときの社内ルールを決めておくことが重要です。ルールがないまま使い始めると、顧客情報や機密資料が意図せずAIに入力されるおそれがあります。
利用前に決めておきたい項目は、以下のとおりです。
- AIに入力してよい情報と禁止する情報
- AIに任せてよい作業と人が承認する作業
- AIエージェントに与える権限の範囲
- 成果物を確認する担当者と確認の手順
一般向けに提供されたときのデータの扱いは、提供の条件が公表されてから確かめる必要があります。社内ルールを先に決めておけば、提供が始まったときに試すまでの手続きを短くできます。
生成AIの社内ルールの作り方を徹底解説!盛り込む項目とひな形も紹介
Gemini 4 Argonと他のモデルの使い分け
Gemini 4 Argonは、一般に公開されるまで多くの会社では使えません。Gemini 4 Argonと他のモデルの使い分けは、以下の4つです。
- 公開後にGemini 4 Argonで試したい仕事は法務・金融の調査と長い資料を扱う仕事
- 非常に長い開発と科学研究の作業はGPT-6 Astraも候補に残す
- ターミナルでの開発はClaude Opus 5.5とも比べる
- 公開までは今使えるモデルで仕事を進める
公開後にGemini 4 Argonで試したい仕事は法務・金融の調査と長い資料を扱う仕事
Gemini 4 Argonが他のモデルとの差を大きくつけたのは、Googleの比較表の知的作業と長い入力の評価です。公開後に最初に試したい仕事は、以下のとおりです。
- 法律の調査や文書の下書き
- 複数の手順が続く金融の調査
- 25万6,000〜100万トークンの長い資料を扱う仕事
- 長い動画や専門的なグラフの読み取り
法律や金融の成果物は、AIの点数が高くても専門家の確認が欠かせません。法律の評価の点数は4モデルとも20%未満で、AIに任せきりにできる水準には届いていないためです。
非常に長い開発と科学研究の作業はGPT-6 Astraも候補に残す
数時間から数十時間かかる開発の評価FrontierSWE v2と、コンピューター操作の評価OSWorld-2.0では、GPT-6 Astraが1位でした。コンピューター操作のもう1つの評価Agent's Last Examでは、Gemini 4 Argonが1位です。科学研究の作業を測るTerminal-Bench Science 0.1でも、最も高い点数はGPT-6 Astraの68.1%でした。
GPT-6 Astraは、ChatGPTのPlus以上のプランとOpenAI APIで今すぐ使えます。長い開発を任せる場合は、Gemini 4 Argonの公開後に同じ課題を両方に出して比べると、どちらが自社の仕事に合うかを判断できます。
GPT-6 Astraとは?料金・性能・使い方と第三者評価を徹底解説
ターミナルでの開発はClaude Opus 5.5とも比べる
ターミナルでのエージェントの作業を測るTerminal-bench 4.0では、Claude Opus 5.5が66.4%で飛び抜けた1位でした。Claude Codeのようにターミナルで開発を進める道具を使うなら、Claude Opus 5.5は有力な選択肢です。
Claude Opus 5.5は、Claude CodeのPro・Max・Team・Enterpriseのプランで既定のモデルに設定されています。Claude Codeを使っている会社は、追加の設定なしでClaude Opus 5.5を試せます。
Claude Codeの料金プランを徹底解説!MaxとAPI課金の選び方も紹介
公開までは今使えるモデルで仕事を進める
Gemini 4 Argonの一般公開の日付は決まっていないため、公開を待って仕事を止める必要はありません。今使える主なモデルの選び方は、以下の表のとおりです。
| 仕事の種類 | 今使える候補 |
|---|---|
| 普段の資料作成や開発 | GPT-6.1 Sol、Claude Opus 5.5 |
| 最も難しい研究や長時間の開発 | GPT-6 Astra、Claude Fable 5.1 |
| 無料で試したい仕事 | Gemini 3.1 Pro(Geminiアプリの無料版) |
GPT-6.1 SolとClaude Opus 5.5は、上位モデルに近い性能を低い単価で使えるモデルです。GPT-6 AstraとClaude Fable 5.1は、難しい推論や長時間のエージェントの作業に向けた各社の最上位のモデルにあたります。
Gemini 4 Argonの公開後は、同じ課題をGemini 4 Argonと今のモデルに出し、品質と費用を比べてから切り替えるかを決めましょう。
Gemini 4 Argonに関するよくある質問
Gemini 4 Argonについて出やすい質問は、以下の6つです。
- Gemini 4 Argonの読み方は?
- Gemini 4 Argonはいつから使える?
- Gemini 4 Argonは無料で使える?
- Gemini 3と4の違いは何?
- Gemini 4 ProとGemini 4 Argonの関係は?
- Gemini 4 Argonは日本語で使える?
Gemini 4 Argonの読み方は?
Gemini 4 Argonの「Argon」は「アルゴン」と読みます。元素のアルゴンと同じつづりですが、Googleは名前の由来を2026年10月1日時点で公表していません。
Geminiは「ジェミニ」と読み、Googleが開発するAIモデルとAIアシスタントのアプリに共通する名前です。
Gemini 4 Argonはいつから使える?
2026年10月1日時点で、Gemini 4 Argonの一般公開の日付は公表されていません。現在使えるのは、Fairwindプログラムに参加するサイバー防御の組織とGoogle社内だけです。
次の段階では、有料のGemini APIの利用者とGoogle AI Ultraの契約者に提供が広がります。その後に、開発者・企業・一般の利用者へ広がる予定です。
Gemini 4 Argonは無料で使える?
Gemini 4 Argonを無料で使えるかどうかは、公表されていません。次の提供先として発表されているのは、有料のAPIとGoogle AI Ultraの契約者です。
無料で新しいGeminiを試したい場合は、Geminiアプリの無料版で制限付きで使えるGemini 3.1 Proが選択肢になります。
Gemini 3と4の違いは何?
Gemini 3の世代の上位モデルGemini 3.1 Proと比べると、Gemini 4 Argonは出力の上限が65,536トークンから100万トークンに広がりました。導入価格は入力2ドル・出力10ドルで、Gemini 3.1 Proより出力の単価が低く設定されています。
提供の範囲も違います。Gemini 3.1 Proは無料版のGeminiアプリでも使えますが、Gemini 4 Argonの提供先は限られた組織だけです。性能を同じ評価で比べた点数は、2026年10月1日時点で公表されていません。
Gemini 4 ProとGemini 4 Argonの関係は?
発表前のリーク情報では、Googleの次のモデルが「Gemini 4 Pro」の名前で取り上げられていました。Googleが発表した正式な名前はGemini 4 Argonで、Gemini 4 Proという名前のモデルは2026年10月1日時点で発表されていません。
リーク情報で伝えられていた出力の上限の数字は、Googleが公表した100万トークンとは異なります。Gemini 4 Argonの仕様は、Googleの公式発表で確認するのが確実です。
Gemini 4 Argonは日本語で使える?
Gemini 4 Argonの日本語の性能と日本での提供は、2026年10月1日時点で未公表です。比較表の18項目にも、日本語の評価は含まれていません。
前の世代のGemini 3.1 Proは、日本のGeminiアプリで日本円のプランとともに提供されています。Gemini 4 Argonが日本語でどこまで使えるかは、公開後に普段の日本語の資料で試すと確かめられます。
Gemini 4 Argonの公開に備えて、任せたい仕事を今のうちに決めよう
Gemini 4 Argonは、Googleが2026年9月30日に発表した最上位のAIモデルです。GPT-6 Astra・Claude Fable 5.1・Claude Opus 5.5と比べた18項目のうち12項目で単独1位となり、特に法務・金融の知的作業と長い資料の扱いで差をつけました。
Gemini 4 Argonについて押さえたい要点は、以下のとおりです。
- 出力の上限は100万トークンで、入力の上限は公表されていない
- 導入価格は入力2ドル・出力10ドルで、導入期間の後は2倍になる
- 非常に長い開発と科学研究の作業はGPT-6 Astra、Terminal-bench 4.0ではClaude Opus 5.5が上回る
- 提供はFairwindプログラムとGoogle社内からで、一般公開の日付は決まっていない
- 日本での提供・無料版・日本語の性能は公表されていない
公開前の今のうちに、Gemini 4 Argonへ任せたい仕事の候補と社内ルールを決めておくと、提供が始まったときにすぐ試せます。まずは法務・金融の調査や長い資料を扱う仕事など、自社の仕事で試す課題を1つ選んでおきましょう。
参考にしたページは、以下のとおりです(いずれも2026年10月1日確認)。
- Google「Gemini 4 Argon」
- Google DeepMind「Gemini 4 Argon model evaluation」
- Google DeepMind「Gemini for cyber defense」
- Google DeepMind「Fairwind program」
- Google「Fairwind program」発表記事
- Google DeepMind「Model cards」
- Google AI for Developers「Gemini 3.1 Pro Preview」
- Google AI for Developers「Gemini API models」
- Google AI for Developers「Gemini API pricing」
- Google DeepMind「Gemini 3.1 Pro model card」
- Google「Gemini 3.1 Pro」発表記事
- Google「Geminiのプラン」
- OpenAI「GPT-6 Astra」
- OpenAI「Introducing GPT-6.1 Sol」
- OpenAI API「GPT-6 Astra」
- OpenAI API「GPT-6.1 Sol」
- OpenAI Help「ChatGPT Work and Codex」
- Anthropic「Claude Opus 5.5」
- Anthropic「Introducing Claude Fable 5.1 and Claude Mythos 5.1」
- Claude Docs「Models overview」
- Claude Docs「Pricing」
- Claude Docs「Refusals and fallback」
- Claude Code Docs「Model configuration」
- Claude「料金プラン」
- Claude Help「Claude Fable 5 on your plan」



