· CTO Marcus テクノロジー  · 9 min read

出力トークン17%削減の新Flashと、半額でFable 5に迫るOpus 5——AIの費用は「単価」ではなく「1タスクの総量」で決まる

Googleは7月21日にGemini 3.6 Flashを発表し、出力トークン使用量を前世代比17%削減。Anthropicは7月24日にClaude Opus 5を入力5ドル・出力25ドルで公開しました。単価表の比較では見えない「1タスクあたりの総コスト」という技術選定の物差しを整理します。

Googleは7月21日にGemini 3.6 Flashを発表し、出力トークン使用量を前世代比17%削減。Anthropicは7月24日にClaude Opus 5を入力5ドル・出力25ドルで公開しました。単価表の比較では見えない「1タスクあたりの総コスト」という技術選定の物差しを整理します。

※ 本記事は2026年7月28日時点の公開情報に基づきます。提供状況・価格は変化するため、最新情報は各社公式発表等をご参照ください。

2026年7月21日、GoogleとGoogle DeepMindは「Gemini 3.6 Flash」「Gemini 3.5 Flash-Lite」「Gemini 3.5 Flash Cyber」の3モデルを発表しました。主力の3.6 Flashは入力100万トークンあたり1.50ドル、出力7.50ドルです。ただし技術的に重要なのは単価ではありません。Artificial Analysis Indexによれば、同じ仕事を終えるまでに使う出力トークンが前世代の3.5 Flash比で17%少ないとされ、コーディング評価のDeepSWEでは最大65%削減しながらスコアは37%から**49%へ、MLE Benchは49.7%から63.9%**へ上がった点です(出典: Google 公式ブログ)。

その3日後の2026年7月24日、Anthropicが新モデル「Claude Opus 5」を公開しました。同社は上位モデルFable 5のフロンティア級の知能に半額で迫るモデルと位置づけています。API価格は入力5ドル・出力25ドル(いずれも100万トークンあたり)です(出典: Anthropic 公式)。Fable 5は入力10ドル・出力50ドルで2倍と報じられています(出典: ITmedia NEWS)。効率という同じ軸の発表が、3日のあいだに二社から出ました。

単価表を比べても、請求額は当たらない

AIの利用料金は「単価 × 消費トークン量」で決まります。比較記事は前半だけを並べますが、請求額を動かすのは後半です。しかも出力側の単価は入力側より高いのが通例で、Gemini 3.6 Flashでは出力が入力の5倍にあたります(出典: Google 公式ブログ)。長く書くほど費用は膨らみます。

ここに17%の意味があります。単価が据え置きでも出力量が17%減れば出力側の費用は17%減り、単価も下がるなら効果は掛け算です。最大65%削減はDatacurveのDeepSWEというコーディング系ベンチマークでの観測値で、AIが自ら手順を立てて反復試行する用途ほど効きやすいと考えられます。1回の問い合わせでは数円の違いでも、1日に数百回動く自動化では月額の桁が変わります。

「半額で同等」という示し方

Opus 5の発表資料は、性能を「いくらで出したか」とセットで提示しています。CursorBench 3.2は最大努力(max effort)設定でFable 5の最高スコアとの差が0.5%以内、しかも1タスクあたりのコストは半分、OSWorld 2.0は3分の1強のコストでFable 5の最良結果を上回る、という書き方です。Frontier-Bench v0.1ではOpus 4.8の2倍超とされます(出典: Anthropic 公式)。

提供先はClaude API(識別子claude-opus-5)、claude.ai、Claude Code、Claude Cowork。Claude Maxでは新たに標準モデル、Claude Proでは利用できる最上位モデルで、無料プランでは使えません(出典: ITmedia NEWS)。月額課金でも上位モデルに手が届きます。

効率は自社の業務でしか測れない

ベンチマークは他人の課題です。自社の見積書作成や問い合わせ返信で17%減る保証はありません。代表的な業務を3つ選び、同じ入力を新旧モデルに与えて、1件あたりの入出力トークンと手直しの有無を記録します。APIなら応答の使用量、SaaS経由なら管理画面の履歴で足ります。10件も回せば実測単価が出ます。

安全面の確認も切替前に必要です。Opus 5はサイバーセキュリティ関連で安全分類器の介入がFable 5比で約**85%**少なくなる見込みとされます。ソースコード上の脆弱性発見は許可される一方、バイナリベースの脆弱性スキャンやペネトレーションテスト、エクスプロイト生成はブロックされ、Claude.ai・Claude Code・Claude Coworkではフラグの立った要求が既定で一世代前のOpus 4.8にフォールバックします(出典: Anthropic 公式)。自動化に組み込む前に、自社の用途がどちら側かを確かめてください。

中小企業への翻訳——「1タスクいくら」で選ぶ

1. 業務単位の原価台帳を持つ 月額の総額ではなく、業務1件あたりの原価を記録します。見積書1本、問い合わせ返信1件、議事録1本。平均トークン量と金額を1行ずつ書けば、切替の効果はその日に判定できます。

2. 長く書かせない設計にする 出力形式を指定する、前置きを禁じる、要約の文字数を決める——プロンプト側の工夫だけで出力量は減ります。モデルを替えずに効く改善です。

3. 用途で機種を分ける すべての用途に上位モデルは要りません。定型の分類や抽出はGemini 3.5 Flash-Lite(入力0.3ドル・出力2.5ドル、出力速度は毎秒350トークン)、判断を伴う作業は上位モデルと割り当てるだけで総額は変わります(出典: Google 公式ブログ)。

まとめ

  • Gemini 3.6 Flashは2026年7月21日発表。入力1.50ドル・出力7.50ドルで、出力トークン使用量は3.5 Flash比17%減、DeepSWEでは最大65%減
  • Claude Opus 5は2026年7月24日公開。入力5ドル・出力25ドルで、CursorBench 3.2は最大努力設定でFable 5の最高スコアとの差が0.5%以内かつ1タスクあたり半額、OSWorld 2.0では3分の1強のコストでFable 5の最良結果を上回る
  • 両社の訴求軸は単価の安さから「同じ仕事にかかる総コスト」へ移り、性能はコストとセットで示されるようになった
  • 日本の中小企業は業務1件あたりの原価を台帳化し、出力量を抑える設計と用途別の使い分けで、切替前後を実測で比べるべき

AIの技術選定は、カタログの単価を並べる作業から、自社の1タスクにいくらかかるかを測る作業へ移りつつあります。よく使う業務を3つ選び、トークン量と金額を1か月記録するだけで、モデルを替えるべきかは数字で答えが出ます。効率を語る材料を外部のベンチマークではなく自社の実績に持つことが、これからのコスト管理の出発点になると私たちは考えます。

※ 本記事は一般的な情報提供を目的としており、個別の法的・財務的・経営的助言ではありません。具体的な課題については専門家にご相談ください。

この記事のテーマについてご相談されたい方へ

代表 服田伸人が率いるHatta AI Groupでは、中小企業の経営課題に関するご相談を承っています。

お問い合わせはこちら

Related Posts

View All Posts »
Moonshot AI「Kimi K3」2.8兆パラメータ・1Mコンテキスト——技術選定の軸は「重みを自社に置けるか」へ
テクノロジー

Moonshot AI「Kimi K3」2.8兆パラメータ・1Mコンテキスト——技術選定の軸は「重みを自社に置けるか」へ

2026年7月16日、中国Moonshot AIが総パラメータ2.8兆・コンテキスト長1,048,576トークンの旗艦モデル「Kimi K3」を発表しました。重みの公開は7月27日までと予告されています。規模の数字ではなく、重みを自社側に置ける選択肢が技術選定に何をもたらすかを読み解きます。