Googleが新しいフロンティアモデル「Gemini 4 Argon」を発表、企業のナレッジワークやサイバーセキュリティで最先端のパフォーマンスを発揮
2026.10.09
Googleは2026年9月30日(米国時間)、新しいフロンティア モデルとしてGemini 4 Argon(ジェミニ 4 アルゴン)を発表した。当初はFairwind Programを通じて、信頼できるサイバーセキュリティの担当者へ順次展開される。
そして開発者や企業、そして一般消費者ができる限り早くArgonを利用できるようにガードレールの改良を進めながら、初期テスターからのフィードバックを引き続き収集していくという。
Argonは導入価格として100万入力トークンあたり2ドル 、100万出力トークンあたり10ドルで提供され、キャッシュ済みの入力トークンについては入力トークン価格の 95%オフで利用できる。
そんなGemini 4 Argonの概要と特徴を、同社発表ブログをベースにまとめてみた。
Googleでの働き方と構築方法を変える
Gemini 4 Argonは、複雑かつ長期的なワークフロー全体にわたって深い推論を持続できるように構築されたモデル。Googleでは既に社内ワークフローを支えており、同社では「チームはより迅速に開発を進め、エンジニアリングの生産性の限界を押し広げ、画期的な成果を加速させることができる」と説明。
さらに、実世界のソフトウェアエンジニアリング、法務や財務といった企業のナレッジワーク、そしてサイバーセキュリティにおける複雑なワークフローにおいて、最先端のパフォーマンスを発揮すると述べている。
その具体例として、以下の例が挙げられている。
■量子アルゴリズムの最適化
Argonは、当社の量子コンピューティング研究者が、重要なアプリケーションのボトルネックとなっているサブルーチンの時空間リソース(量子ビット × ゲート)を最適化するのに役立っている。ある事例では、わずか数分で公表されている基準値を40%も上回った。
■メモリ効率
Argonエージェントのチームが、フリート全体のプロファイリングテレメトリを分析。Googleのデータセンター全体でメモリ最適化を自律的に特定して適用した。これにより、展開後には300TiB以上のメモリが解放され、合計で500TiBから1PiBの節約が見込まれている。
■大規模なコードベースの移行と最適化
Argonエージェントは、Google全体で C/C++ のコードベースを Rust へ移行する作業に取り組んでいる。re2やlibgav1 といったコアライブラリの数万行規模から、Fuchsia Zircon kernelの80万行を超える規模まで拡大している。
こうしたシステムの多くが持つ重要性を考慮して、本番環境への展開前に厳格な自動および手動による監査、エミュレーションテスト、レビューを実施している。
最も複雑な問題への挑戦
より長期的で複雑なユースケースにおけるGemini 4 Argonの能力を最大限に引き出すため、モデルの出力トークン上限を従来の6万4千トークンから、業界をリードする100万トークンへと大幅に拡大された。
モデルが十分な余裕を持って深く思考し、1 つのプロセスの中で数十万トークンを生成できるようになったことで、困難な問題を一気に解決するためのこれまでにない深い推論力が得られる。

あらゆる領域におけるコーディングと業務フロー効率の実現
Googleのエンジニアは、日常的なデバッグから大規模なコードベースの移行、アルゴリズム設計に至るまで、日々の業務にArgonを活用してきた。実世界の長期的なソフトウェアエンジニアリングタスクにおけるモデルの性能を測定するDeepSWE v1.1 (77.9%) において、新たな記録も更新している。
コーディングにとどまらず、Argonは、財務、コーディング、法務、税務ワーク全体にわたる経済的インパクトを測定し、各セクターを米国の GDP への貢献度に応じて重み付けした Vals Indexにおいて、トップのモデルとなっている。
Vals Finance Agent v2 (多段階の財務リサーチ)やHarvey’s Legal Agent Benchmark (法務リサーチとドラフティング)といった他のドメイン特化型評価においても、同様にリードするパフォーマンスを発揮。コアビジネス機能全体のエンドツーエンドの実行を測定するZapierのベンチマークAutomationBenchでは、51.3% のスコアを記録して1位 を獲得している。
また、ナレッジワークに視覚的理解が求められる場面でも、Argon は圧倒的な能力を発揮する。専門的なチャート分析の実行、長尺動画からの細部の特定、一連のドキュメントに基づくアクションの実行が可能であり、たとえば、長尺動画の理解力を測定する LVBench では、91.7% のスコアを記録。最先端の性能を証明した。

サイバーセキュリティにおける優位性
新時代のサイバー攻撃に向けてサイバーセキュリティの担当者をより強力にサポートするため、Gemini 4 Argonはサイバーセキュリティにおいて極めて高い能力を発揮するようにトレーニングされている。
セキュリティ脆弱性の修復能力を評価するCWE-bench v1において、ArgonはCWE-bench v0 における3.8 Flash Cyberのフロンティアパフォーマンスをさらに発展させ、最高スコアの 68%で同率首位に輝いた。
Argonは一部のサイバーセキュリティ担当者や Google の社内チームに向けては、フロンティアレベルの能力を最大限に活用できるよう、サイバーガードレールを外した状態で提供される。

一般提供に向けたフロンティアセーフガードの強化
Gemini 4 Argonを広く展開する前に、以下の4つの主要な領域にわたって、重要なフロンティアセーフガードの強化が継続されている。
■悪用に対する防御
悪意ある行為者が Argonをサイバー攻撃や化学・生物・放射性物質・核攻撃に利用するのを防ぐため、同社のFrontier Safety Frameworkに則り、正当な二用途の科学的研究を保護しつつ、有害なリクエストを拒否するように設計された。
同社によれば、今回のローンチに向けて、悪用を検知するためにモデルのインターナル アクティベーションをモニタリングする技術の向上など、セーフガードの堅牢性をさらに強化しているという。
■プロンプトインジェクション攻撃に対する防御
Argonは、悪意ある指示やコンテキストを用いてモデルの挙動を乗っ取る間接的プロンプトインジェクションに対しても、これまでで最も高い耐性を備えたモデルになっている。
これらは、不断の警戒と多層的な防御を必要とする複雑な攻撃だ。自動化されたレッドチーミングと敵対的トレーニングを通じて、Gemini 4 ArgonはGray SwanのIndirect Prompt Injection(IPI)ベンチマーク において、プロンプトインジェクションに対する堅牢性でトップに立っている。

■アライメントの不一致のモニタリング
Argonがユーザーの意図を逸脱した方法でタスクを達成しようとして範囲外の動作を行なうことを防ぐため、Argonの思考プロセスとアクションをモニタリングし、必要な場合に実行を停止するミスアライメント軽減策が導入されている。
トレーニングの実行状況を監視し、専任のインシデント対応チームにアラートを送信するために同様のシステムを使用している。その際、Argonの推論が同社のモニタリングを回避するように形成されるリスクを冒さないよう、発見事項をトレーニングにフィードバックしないように十分な注意が払われた。
■システムのハードニング
最先端モデルの能力が高まるにつれて、それらを安全にテストするためには、システム自体の進化に追従できる強固な環境が求められてくる。
エージェント制御のロードマップに沿って、高リスクなトレーニングや評価が開始される前に、サンドボックス環境を隔離・密閉することでその堅牢性を高めている。
同社では本件について「エコシステム全体でのセキュリティ向上に向けて、こうしたエージェントのセキュリティに関するベストプラクティスをパートナーの皆様と共有することに尽力しています」と述べている。
関連情報
https://blog.google/intl/ja-jp/company-news/technology/gemini4argon/
構成/清水眞希




DIME MAGAZINE














