Google Gemma 4 にステルス更新——Hopper GPU で最大70%高速化、ツール呼び出しバグも修正
同じモデル名のまま、全パラメータサイズ(12B・31B・E4B)が更新。プロンプト処理速度の大幅向上と画像解像度の改善が開発者に朗報。
Google は Gemma 4 に静かなアップデートを実施した。モデル名は変わらないままだが、全パラメータサイズ(12B・31B・E4B)が更新されており、開発者向けの改善が複数含まれている。
主な改善点
パフォーマンス向上(Hopper GPU)
Nvidia の Hopper アーキテクチャを搭載する GPU で実行する際、大幅な高速化が実現した。
- プロンプト処理速度:25~70% の高速化
- 初回トークン生成までの時間(TTFT):最大 31% の削減
これらの向上は Flash Attention 4 の有効化によって達成されており、長時間のコンテキスト処理が必要なタスクでは特に効果的だ。
バグ修正:ツール呼び出しと応答の完全性
開発者から報告されていた2つの重大な問題が解決された。
ツール呼び出し機能の改善
- Gemma 4 が外部 API やローカルコマンドを自動実行する際のバグを修正
- ファンクションコーリング・エージェント型ワークフローの信頼性が向上
不完全な応答の削減
- 生成過程で応答が途中で切れる問題に対応
- 特に長いコンテキストウィンドウでの使用時に効果的
画像処理の強化
Gemma 4 の画像理解能力も改善された。
- max_soft_tokens パラメータ:280 から 1,120 に拡張可能
- 対応解像度:最大 2.51 メガピクセルの画像をサポート
- ドキュメント解析・図表認識がより詳細に
全パラメータサイズが対象
特に重要なのは、12B・31B・E4B の全モデルサイズが同時にアップデートされたという点だ。小型モデルを使っている開発者にも、エッジデバイスやコスト最適化を目指すチームにも、同等のパフォーマンス向上が適用されている。
開発者コミュニティからの指摘
社内では「Gemma 4.1」として区別すべきではないか、との意見も出ている。同じモデル名での更新は、ベンチマーク比較や実装時のバージョン管理に若干の混乱をもたらす可能性があるためだ。
なぜステルス更新なのか
Google が大型アナウンスを避けた理由は不明だが、急速な改善サイクルを示す一方、アップデートの詳細がドキュメントに反映されるまでにタイムラグが生じる可能性がある。公式ドキュメントを確認の上、本番環境での導入を検討する際は最新情報の確認が必須だ。
市場への示唆
このアップデートは、Google がオープンウェイト LLM 分野でも継続的な改善を加える姿勢を示している。Claude・GPT・Mistral など主要モデルとの競争が続く中、Gemma のような無料・オープンのモデルも実用性を高め続けている。エッジデバイスやコスト重視の環境では、Gemma 4 の選択肢がますます有力になるだろう。