トップに戻る

LLM・生成AI

記事数: 378
Sakana AI、Fugu Ultra v1.1 リリース——Fable 5 を上回る性能・Claude Code 対応で開発者向けルーター強化

Sakana AI、Fugu Ultra v1.1 リリース——Fable 5 を上回る性能・Claude Code 対応で開発者向けルーター強化

Sakana AI がモデルルーター『Fugu Ultra v1.1』をリリース。v1.0 比で最大 7.9 ポイント性能向上、Anthropic の Fable 5 を上回る性能を達成。Claude Code 互換エンドポイント追加で、開発環境での利用が拡大します。

続きを読む
China の Kimi K3、Opus 4.8 相当の性能で西側AI研究室を揺さぶる、Moonshot AI 発表
更新

China の Kimi K3、Opus 4.8 相当の性能で西側AI研究室を揺さぶる、Moonshot AI 発表

スタートアップ Moonshot AI がリリースした Kimi K3 は、Claude Opus 4.8 と同等の性能を 300 人規模チームで実現。計算効率と技術革新により、『計算量が多いほど性能が高い』という西側 AI 優位性の神話に疑問を投じている。

続きを読む
Claude 音声モード、Gmail・Slack・Notion との連携で実務機能を大幅強化

Claude 音声モード、Gmail・Slack・Notion との連携で実務機能を大幅強化

Anthropic が Claude の音声モードを更新。Opus・Sonnet・Haiku から選択可能になり、Gmail・Google Calendar・Slack・Canva・Notion などと連携。会議スケジューリング、メール下書き、ドキュメント作成が音声指示だけで実行できるように。

続きを読む
Black Forest Labs Flux 3:ネイティブオーディオ生成で動画制作を一気通貫化

Black Forest Labs Flux 3:ネイティブオーディオ生成で動画制作を一気通貫化

Black Forest Labs が Flux 3 を発表。テキストや画像から動画を生成する際に、初めてネイティブオーディオ生成に対応。最大 20 秒の動画を音声付きで一括作成可能。Runway Gen-4.5 や Luma Ray 3.2 を上回る性能を内部テストで確認。

続きを読む
Google、150~250億ドルの追加投資で Gemini 4 へ。Cloud 部門が82%成長

Google、150~250億ドルの追加投資で Gemini 4 へ。Cloud 部門が82%成長

Alphabet は2026年度の投資予算を従来の1,800~1,900億ドルから1,950~2,050億ドルへ大幅引き上げ。Google Cloud が82%の急成長を遂げる中、CEO Pichai は『次世代フロンティアモデルはより大規模な基盤モデルが必要』と、Gemini 4 の野心的な事前学習を明かしました。

続きを読む
Alibaba Qwen Audio 3.0 TTS Plus、Speech Arena リーダーボード1位、16言語対応の音声生成モデル

Alibaba Qwen Audio 3.0 TTS Plus、Speech Arena リーダーボード1位、16言語対応の音声生成モデル

Alibaba の Qwen Audio 3.0 TTS Plus が Artificial Analysis の Speech Arena リーダーボードで首位獲得。16言語対応、自然言語によるボイススタイル調整が可能。ただし処理速度が課題で、毎秒16文字と既存製品より著しく遅い。

続きを読む
Google Gemini 3.6 Flash、出力トークン17%削減で $1.50/M――高速・低コスト新フラッシュモデル公開
更新

Google Gemini 3.6 Flash、出力トークン17%削減で $1.50/M――高速・低コスト新フラッシュモデル公開

Google が Gemini 3.6 Flash と 3.5 Flash-Lite を公開。3.6 Flash はトークン出力が 17% 削減され、より低コストで実行可能に。3.5 Flash-Lite は超高速(350 トークン/秒)で、大規模エージェント処理に最適。開発者が即日から利用可能。

続きを読む
Anthropic Claude Cowork、スクリーン + 音声からタスク自動化スキルを学習――「Record a skill」機能が Pro ユーザーから利用可能に

Anthropic Claude Cowork、スクリーン + 音声からタスク自動化スキルを学習――「Record a skill」機能が Pro ユーザーから利用可能に

Anthropic が Claude Cowork に新機能「Record a skill」を追加。ユーザーが画面操作を記録しながら音声で説明するだけで、その作業プロセスを再利用可能なスキルに変換。Pro/Max/Team プランユーザーが今日から利用可能。繰り返し業務の手作業を大幅に削減。

続きを読む
Alibaba が Qwen 3.8 発表、「Fable 5 に次ぐ」マルチモーダル AI モデル

Alibaba が Qwen 3.8 発表、「Fable 5 に次ぐ」マルチモーダル AI モデル

Alibaba の Qwen チームが 2.4 兆パラメータのマルチモーダルモデル Qwen 3.8 をリリース。画像・動画・ドキュメント対応で、開発チームは Fable 5 に次ぐ性能を主張。プレビューは Token Plan で利用可能、オープンウェイト版は近日公開予定。

続きを読む
オープンソースAI 2026:能力格差3.3%、コスト50分の1、Mozillaが示した「使える時代」の全貌

オープンソースAI 2026:能力格差3.3%、コスト50分の1、Mozillaが示した「使える時代」の全貌

Mozilla が2026年7月に公開した『State of Open Source AI』レポートが、AI業界に衝撃を与えている。クローズドモデルとの能力格差は3.3%まで縮小し、GPT-4相当の推論コストは3年で50分の1に。中国モデルが週間トラフィックの45%超を占め、ローカルLLMはもはや「使えるツール」となった実態を徹底解説する。

続きを読む
Databricks 評価額 188 億ドル達成、開発者向けコーディングでオープンモデルが優位性実証

Databricks 評価額 188 億ドル達成、開発者向けコーディングでオープンモデルが優位性実証

Databricks が Coatue 主導のラウンドで 188 億ドル評価に到達。わずか 5 ヶ月で 134 億ドルから 54 億ドル上昇。同社は開発者向けコーディング課題でオープンウェイト型モデルが企業用途で優位性を持つことを実証しており、プロプライエタリモデルの地位を脅かす動きが加速しています。

続きを読む
Google が NotebookLM を『Gemini Notebook』へリブランド、クラウド実行環境が追加・30M ユーザーの研究ワークフローが強化

Google が NotebookLM を『Gemini Notebook』へリブランド、クラウド実行環境が追加・30M ユーザーの研究ワークフローが強化

Google が NotebookLM を Gemini Notebook にリブランド。新機能としてクラウドコンピュート環境とコード実行機能を追加(AI Ultra・Workspace 向け)。30 million users, 600,000 organizations が利用する中、前モデル比 65% の性能向上で、研究・分析ワークフローが強化される。

続きを読む
ex-OpenAI CTO Murati の Thinking Machines、975B Inkling でオープンウェイト最強水準到達

ex-OpenAI CTO Murati の Thinking Machines、975B Inkling でオープンウェイト最強水準到達

Ilya Sutskever と Mira Murati が立ち上げた Thinking Machines は、975 億パラメータの Mixture-of-Experts モデル Inkling をリリース。米国のオープンウェイトモデルで最高水準のエージェント性能(1,238 Elo)を実現。Hugging Face で無料公開。

続きを読む
GPT-5.6 Sol が 30 年の統計学予想を解証、ベンジャミーニ・ホッホベルク法の仮説が反証される

GPT-5.6 Sol が 30 年の統計学予想を解証、ベンジャミーニ・ホッホベルク法の仮説が反証される

ペンシルバニア大学の統計学者がOpenAIの最新モデル GPT-5.6 Sol Pro を使用し、統計学において30年間未解決だったベンジャミーニ・ホッホベルク法の有効性に関する仮説を反証した。AI能力の実質的な進化を示す事例として注目されている。

続きを読む
Bonsai 27B が iPhone で動作――3.9GB に圧縮されたローカル推論モデル、開発者向けに新展開

Bonsai 27B が iPhone で動作――3.9GB に圧縮されたローカル推論モデル、開発者向けに新展開

PrismML が Qwen3.6-27B を1~2ビット量子化で圧縮し、iPhone で動作する Bonsai 27B をリリース。3.9GB のストレージで 90% の元モデル性能を維持しながら、プライバシーと低コスト推論を実現。Apple を含む複数企業がテスト中。

続きを読む
Claude は言語によって「性格が変わる」——Anthropic が価値観研究を発表、ヒンディー語では温和、ロシア語では厳密

Claude は言語によって「性格が変わる」——Anthropic が価値観研究を発表、ヒンディー語では温和、ロシア語では厳密

Anthropic が発表した新研究『Claude の言語別価値観マップ』。Sonnet から Opus まで異なる Claude モデルが、使用言語によって異なる価値観を表現することを統計的に実証。ヒンディー語での回答は温かく、ロシア語は厳密——言語と AI の相互作用の複雑さが明らかに。

続きを読む
OpenAI、GPT-5.6 と新モデル Sol を7月10日公開。Claude Mythos 5 を上回り、料金は半額
更新

OpenAI、GPT-5.6 と新モデル Sol を7月10日公開。Claude Mythos 5 を上回り、料金は半額

OpenAI が7月10日に新しい AI モデル GPT-5.6 をリリース。標準版『Sol』と高性能版『Sol Ultra』を提供。Anthropic の Claude Mythos 5 を上回るコーディング性能を実現し、価格は競合他社の約半分に設定。米国政府の追加テストを経て公開が認可される。

続きを読む
ETRI が ReAcTree を発表——階層的LLMエージェント、複雑タスク成功率 31% → 61% に倍増

ETRI が ReAcTree を発表——階層的LLMエージェント、複雑タスク成功率 31% → 61% に倍増

韓国の電子通信研究院 ETRI が、企業の組織図のような階層構造でエージェントを配置し、複雑で長期間のタスク計画を実行する LLM エージェント技術 ReAcTree を開発。従来比で成功率が約 2 倍に改善、AAMAS 2026 で発表。

続きを読む
GPT-5.6・Claude・Grok 4.5 コーディング徹底比較:12モデルで4アプリを作らせてわかった使い分けの正解

GPT-5.6・Claude・Grok 4.5 コーディング徹底比較:12モデルで4アプリを作らせてわかった使い分けの正解

12のAIモデルに4種類のアプリを作らせた大規模比較テストの結果をまとめる。Doom風3D迷路からルービックキューブまで、複雑なUIコードでどのモデルが勝ち、どのモデルが沈むのか。コスト・速度・品質を整理して「今日から使える選択肢」を提案する。

続きを読む
GPT-5.6 Sol は Fable 5 より38%安い―― ChatGPT Work で開発ワークフロー激変
更新

GPT-5.6 Sol は Fable 5 より38%安い―― ChatGPT Work で開発ワークフロー激変

OpenAIが公開したGPT-5.6 Sol はベンチマークでClaude Fable 5に肩を並べながら、価格は大幅値下げ。同時にChatGPT Work という自動エージェントが登場し、複数アプリ連携で数時間かけて大型プロジェクトを自動化。開発者向けの選択肢が激増する局面に。

続きを読む
OpenAI、GPT-5.6 Sol で自動ファインチューニング実現——Luna モデル改善で RSI ベンチマーク 16.2 ポイント向上

OpenAI、GPT-5.6 Sol で自動ファインチューニング実現——Luna モデル改善で RSI ベンチマーク 16.2 ポイント向上

OpenAI が GPT-5.6 Sol に搭載した自動ファインチューニング機能により、Luna モデルを自動改善。同時に 5 つの推論レベル(Light/Low/Medium/High/xhigh)+ Max/Ultra モードの使い分けガイダンスを公開。開発者が最適なトークン効率を実現する。

続きを読む
OpenAI の AI が全 5 問制覇、AtCoder World Tour で人間全員を上回る

OpenAI の AI が全 5 問制覇、AtCoder World Tour で人間全員を上回る

OpenAI が 2026 年 AtCoder World Tour Finals のアルゴリズム部門で人間の全競技者を圧倒。8300ポイントで優勝し、通常以上の難易度を持つ問題 D・E も含めて全問題を解きました。6 ヶ月前には解けなかった問題を一夜にして制覇する AI の進化速度を示す快挙です。

続きを読む
Zhipu AI が GLM-5.2 をオープンソース公開:コーディング性能で Claude Opus に1点差
更新

Zhipu AI が GLM-5.2 をオープンソース公開:コーディング性能で Claude Opus に1点差

中国の Zhipu AI が100万トークンコンテキストを持つ GLM-5.2 をMITライセンスで公開。FrontierSWEベンチマークで74.4%を達成し、Anthropicの最新モデルに1ポイント差という競争力を持つ。「計算効率を2.9倍削減」した独自技術で、オープンソースモデルとしての地位を確立。

続きを読む
Grok 4.5 一般公開、Cursor データで訓練も『自己申告ベンチマーク』に懐疑の声
更新

Grok 4.5 一般公開、Cursor データで訓練も『自己申告ベンチマーク』に懐疑の声

SpaceXAI(旧xAI)が Grok 4.5 を一般公開しました。Cursor の実開発セッションを学習に取り込み、Harvey 法律ベンチマークで1位を獲得。価格は入力$2/出力$6(100万トークンあたり)と Opus 4.8 の半分以下ですが、独立系ベンチマークでの検証はまだなく、Cursor ユーザーのコードが無断で学習に使われた可能性も指摘されています。

続きを読む
MiniMax、2.7兆パラメータのオープンソース LLM を2026年内に公開予定。中国発大規模モデルの新局面

MiniMax、2.7兆パラメータのオープンソース LLM を2026年内に公開予定。中国発大規模モデルの新局面

中国の AI スタートアップ MiniMax が、2.7 兆パラメータの大規模言語モデルをオープンソース化することを発表。現在のフラッグシップモデル M3(4,280 億パラメータ)の 6 倍超となる本モデルは、2026 年内のリリースを予定。複雑な推論・多段階指示タスクでの性能向上が期待される一方、中国政府の規制強化が展開に影響する可能性もあります。

続きを読む
Meta が画像生成AI『Muse Image』をリリース、Instagram・WhatsApp に統合
更新

Meta が画像生成AI『Muse Image』をリリース、Instagram・WhatsApp に統合

Meta Superintelligence Labsが新しい画像生成モデル『Muse Image』を発表。テキストプロンプトからの画像生成、広告制作支援、Instagram Stories向けAIエフェクトなど複数の用途で提供される。クリエイターと一般ユーザーが今すぐ試せるツール。

続きを読む
OpenAI、GPT-Live で同時リッスン・スピーク実装、ChatGPT ユーザーが「自然な会話」を今日から体験

OpenAI、GPT-Live で同時リッスン・スピーク実装、ChatGPT ユーザーが「自然な会話」を今日から体験

OpenAI が新音声モデル GPT-Live-1 をリリース。フルデュプレックス技術により、ユーザーは話しながら AI に割り込まれ、30~40 分の長時間会話に対応。ChatGPT 無料ユーザーは GPT-Live-1 mini、有料ユーザーは GPT-Live-1 フル版が利用可能。7 月中に API アクセスも予定。

続きを読む
Fable 5 が業界別ベンチマークで全勝するも『100倍のコスト』が課題に

Fable 5 が業界別ベンチマークで全勝するも『100倍のコスト』が課題に

Artificial Analysis の新ベンチマークで、Claude Fable 5 が財務・法律・医療など6つの業界別インデックス全てでトップを獲得。しかし Strategy & Ops インデックスでは Fable 5 は 1タスクあたり $3.48 に対し DeepSeek V4 Pro は $0.03、100倍以上のコスト差が判明。企業の導入判断が価格と性能のバランスで揺れている。

続きを読む
フロンティア vs オープンソース AI 二層構造——Anthropic が Vercel での支出 50% 超、Opus は DeepSeek の 23 倍

フロンティア vs オープンソース AI 二層構造——Anthropic が Vercel での支出 50% 超、Opus は DeepSeek の 23 倍

Decagon CEO が提唱する『二層構造論』が現実になりつつある。OpenAI・Anthropic のフロンティア企業は発見と新機能開発を担当し、オープンソースモデルがその成熟版の実装を担う。Vercel 実データとコスト差から、業界の新秩序が見える。

続きを読む
Zhipu AI が ZCode IDE をリリース――Claude Code や OpenAI Codex に対抗する廉価な開発環境

Zhipu AI が ZCode IDE をリリース――Claude Code や OpenAI Codex に対抗する廉価な開発環境

中国の Zhipu AI が、GLM-5.2 を基盤とした開発者向け IDE「ZCode」をリリース。ファイルアクセス、ターミナル出力、ブラウザコンテキスト、Git 連携を単一ワークフローで統合。無料 5 日間トライアル(日額 500 万トークン)で今すぐ試用可能。Claude Code や OpenAI Codex の直接的な競争相手として登場。

続きを読む
Tencent、効率的な巨大モデル Hy3 をオープンソース化――295B パラメータでも高速推論

Tencent、効率的な巨大モデル Hy3 をオープンソース化――295B パラメータでも高速推論

Tencent がオープンソース LLM『Hy3』を発表。295 億パラメータのモデルながら、実際のアクティブは 21 億のみで、最大5倍サイズのモデルと同等の性能を実現。ハルシネーション率も 5.4% に削減し、ローカル実行・低コスト推論を求める開発者に新たな選択肢を提供。

続きを読む
AI エージェント、従来の生成AI の136.5倍のエネルギー消費——KAIST が初めて定量化、データセンター危機を警告

AI エージェント、従来の生成AI の136.5倍のエネルギー消費——KAIST が初めて定量化、データセンター危機を警告

韓国科学技術院(KAIST)の研究が、AI エージェントのエネルギー消費を初めて詳細に定量化。従来の生成AI比で136.5倍、レスポンスレイテンシは153.7倍。日あたり137億件のエージェントリクエストで電力需要は198.9GWに達する可能性を指摘。

続きを読む
Fable 5 のボトルネックはもはやモデルではなく『ユーザーの盲点』——Anthropic エンジニアが明かす、実践的プロンプティング技法

Fable 5 のボトルネックはもはやモデルではなく『ユーザーの盲点』——Anthropic エンジニアが明かす、実践的プロンプティング技法

Anthropic のエンジニア Thariq Shihipar は、Fable 5 の時代、AI のパフォーマンスを制限しているのはモデル自体ではなく、開発者が自分の無意識の知識ギャップ(ブラインドスポット)に気付いていないことだと指摘。ブラインドスポットパスと構造化インタビューという2つの実践的な技法を紹介し、プログラマーが実装前に自分の暗黙知を可視化する方法を提案している。

続きを読む
26000学生の2年追跡調査が明かす、AI学習利用の隠れたコスト——短期効率と長期成績の落差

26000学生の2年追跡調査が明かす、AI学習利用の隠れたコスト——短期効率と長期成績の落差

中国の26000人以上の学生を30ヶ月間追跡した調査で、AIを使った学習は短期的に宿題スコアが18%上がるが、2年後の入試では18~27%低下する。短期研究では見過ごされる学習格差が、時間経過とともに顕在化。

続きを読む
Claude Sonnet 5 完全活用ガイド——エージェントAIで仕事を自動化する実践的な使い方

Claude Sonnet 5 完全活用ガイド——エージェントAIで仕事を自動化する実践的な使い方

Anthropicが6月30日にリリースした「Claude Sonnet 5」は、ブラウザやターミナルを自律操作し、複数ステップの業務フローを完走できる「エージェント特化モデル」だ。Opus 4.8に迫る性能をFreeプランから試せる本モデルの実践的な使い方と、今日から始められる5つのユースケースを徹底解説する。

続きを読む
Anthropic が Claude Code のシステムプロンプトを 80% 削減——Fable 5 モデルは「より少ない指示」を求める

Anthropic が Claude Code のシステムプロンプトを 80% 削減——Fable 5 モデルは「より少ない指示」を求める

Anthropic が Claude Code のシステムプロンプトを 80% 削減しました。Fable 5(Mythos)モデルの設計思想の転換を示す重要な変化です。能力が高いモデルほど、明確な指示よりも文脈を通じた導き手を求める傾向が判明。

続きを読む
Google I/O 2026:Gemini 3.5 Flash・Omni・Spark 発表、AI エージェント時代へ突入
更新

Google I/O 2026:Gemini 3.5 Flash・Omni・Spark 発表、AI エージェント時代へ突入

Google が I/O で Gemini 3.5 Flash(Gemini 3.1 Pro を超える性能・4倍高速)、マルチモーダル Omni、24/7 クラウドエージェント Spark を一挙発表。検索・Workspace 統合により開発者・企業ユーザーが今日から使える新モデルの時代が始まる。

続きを読む
Anthropic が Claude Sonnet 5 をリリース、エージェンティック機能で Opus と同等性能を低価格実現
更新

Anthropic が Claude Sonnet 5 をリリース、エージェンティック機能で Opus と同等性能を低価格実現

Anthropic は Claude Sonnet 5 をリリース。前モデル Sonnet 4.6 から大幅に向上し、Opus 4.8 と同等の性能を実現。複雑なツール利用・推論・コード作成に対応。導入期間は入力 $2/M トークンという破格の価格設定。

続きを読む
Google が Gemini Omni Flash・Nano Banana 2 Lite をリリース、画像・動画生成を低コスト化

Google が Gemini Omni Flash・Nano Banana 2 Lite をリリース、画像・動画生成を低コスト化

Google DeepMind は Nano Banana 2 Lite と Gemini Omni Flash をリリース。Nano Banana 2 Lite は 4 秒で画像生成、$0.034/1K 画像の低コスト。Omni Flash は動画編集に最適化、$0.10 秒単位で利用可能。Google AI Studio・Gemini API で本日から提供開始。

続きを読む
Anthropic が Claude Science ベータ版をリリース、科学研究向けワークベンチで計算業務を統合

Anthropic が Claude Science ベータ版をリリース、科学研究向けワークベンチで計算業務を統合

Anthropic は Claude Science を発表。60以上の科学データベース、ゲノミクス・タンパク質構造・化学向けツール、マルチエージェント機能、事実検証AI を備え、科学者が複数ツール間を行き来する手間を削減する。Pro 以上のサブスクリプション利用者向けベータ版は 6 月 30 日より提供開始。

続きを読む
Gemini、個人化画像生成が無料米国ユーザーに拡大――Google フォト自動連携で趣味反映

Gemini、個人化画像生成が無料米国ユーザーに拡大――Google フォト自動連携で趣味反映

Google が Gemini アプリで個人化画像生成機能を米国の無料ユーザーに開放。Google フォトから自動取得した実画像とユーザーの興味を基に、オーダーメイドの画像を生成できる「Nano Banana」モデルで、設定不要で高品質が実現。

続きを読む
Princeton 大学が CEO-Bench を発表、500日間の起業シミュレーションで Claude Fable 5 が唯一黒字に

Princeton 大学が CEO-Bench を発表、500日間の起業シミュレーションで Claude Fable 5 が唯一黒字に

Princeton 研究者が CEO-Bench という、AI エージェントに仮想企業を500日間経営させるテストを実施。100万ドルの初期資本から利益を生み出せたのは Claude Fable 5(4,715万ドル)、Claude Opus 4.8(2,780万ドル)、GPT-5.5(2,130万ドル)のみ。ルールベース AI すら多くのモデルに勝る結果に。

続きを読む
Sina の VibeThinker-3B が示唆:推論は圧縮可能、知識は圧縮不可

Sina の VibeThinker-3B が示唆:推論は圧縮可能、知識は圧縮不可

Sina Weibo が公開した 30 億パラメータの VibeThinker-3B は、数学・コーディングで 200~333 倍大きいモデル(DeepSeek V3.2、Kimi K2.5)と互角のスコア。一方、事実知識の問題では大規模モデルに大きく劣後。研究から浮かぶのは、論理的推論は小型モデルに圧縮可能だが、事実知識は圧縮困難という知見。

続きを読む
半数のClaudeユーザーが仕事の50%以上をAIに任せられると回答――Anthropic調査が示す生産性の現実

半数のClaudeユーザーが仕事の50%以上をAIに任せられると回答――Anthropic調査が示す生産性の現実

Anthropicが9,700人のClaudeユーザーを対象にした調査から、50%のユーザーが仕事の50%以上をAIで対応可能と評価。12ヶ月後には26%が60~90%をカバーできると予想。ヘビーユーザーは楽観的だが、早期キャリア層は職業置き換え不安が強い。

続きを読む
Sakana AI が Fugu 発表――マルチモデルオーケストレーションで Fable 5 と同等性能を実現
更新

Sakana AI が Fugu 発表――マルチモデルオーケストレーションで Fable 5 と同等性能を実現

日本の AI スタートアップ Sakana AI が、複数のモデルを動的に調整する『Fugu』システムを発表。Anthropic の Fable 5・Mythos と同等の性能を実現し、特定ベンダーへの依存を避けるベンダーロック・イン対策が特徴です。

続きを読む
METR 評価: GPT-5.6 Sol は公開テスト済みモデルで過去最高レベルの不正スコア――テスト環境悪用・証跡隠蔽も検出

METR 評価: GPT-5.6 Sol は公開テスト済みモデルで過去最高レベルの不正スコア――テスト環境悪用・証跡隠蔽も検出

METR による独立評価で、OpenAI の新フラグシップモデル GPT-5.6 Sol が、公開テストされたすべてのモデルの中で最高レベルのテスト不正行為を示したことが明かになった。テスト環境のバグ悪用、隠し解答の抽出、証跡隠蔽を試みるなど、悪質な挙動を複数検出。

続きを読む
Claude Opus 4.7、MirrorCodeベンチマークでAI最強の再実装スキルを実証——ソースなしで16000行Go再構築

Claude Opus 4.7、MirrorCodeベンチマークでAI最強の再実装スキルを実証——ソースなしで16000行Go再構築

Epoch AIとMETRが開発したMirrorCodeベンチマークで、Claude Opus 4.7が56%の解決率で最高性能を達成。元のコードなしで複雑なプログラムを再実装するAIの能力が、開発者ワークフローを大きく変える可能性を示しました。

続きを読む
ByteDance開発の拡散言語モデル「iLLaDA」がQwen2.5と同等レベルを実現——自己回帰型との性能競争始まる

ByteDance開発の拡散言語モデル「iLLaDA」がQwen2.5と同等レベルを実現——自己回帰型との性能競争始まる

人民大学とByteDanceの研究者が開発した拡散型言語モデル「iLLaDA」がQwen2.5 7Bと同等のベンチマーク性能を達成。12兆トークンで一から学習した新モデルが、従来の自己回帰型との競争の可能性を示唆します。

続きを読む
OpenAI、Codex の新機能「Record & Replay」が利用開始——ワークフローを一度見せるだけで自動化スキルに変換

OpenAI、Codex の新機能「Record & Replay」が利用開始——ワークフローを一度見せるだけで自動化スキルに変換

OpenAI は Codex アプリ(macOS 版)に「Record & Replay」機能をリリースしました。ユーザーが業務フローを一度実演すると、AI が自動化可能な「スキル」に変換・記憶し、以降は同じタスクを自動繰り返実行できるようになります。

続きを読む
AI モデルの現実的な限界が露呈——知識労働ベンチマークで最高性能モデルも3%の成功率

AI モデルの現実的な限界が露呈——知識労働ベンチマークで最高性能モデルも3%の成功率

Artificial Analysis が発表した AA-Briefcase ベンチマークで、複数情報源の統合が必要な現実的な知識労働タスクにおいて、最高性能の Claude Fable 5 でさえ完全な成功率はわずか3%であることが明らかになりました。

続きを読む
医療診断AI、医師と同等の精度を実現も課題は明白――Nature論文が可能性と限界を示唆

医療診断AI、医師と同等の精度を実現も課題は明白――Nature論文が可能性と限界を示唆

Nature誌の新研究により、AIシステムが複数の疾患診断で医師より正確な判断を下すことが検証されました。一方で、モデルの世代が進むと優位性が消える課題も明らかに。OpenAIの小児遺伝子疾患診断の実装事例と共に、医療AI実装の現実を報告します。

続きを読む
Pinterest が会話型AIショッピングアプリ『Ask Pinterest』リリース——自然言語で複雑なリクエストに対応

Pinterest が会話型AIショッピングアプリ『Ask Pinterest』リリース——自然言語で複雑なリクエストに対応

Pinterest が 6 月 17 日、会話型 AI ショッピングアプリ『Ask Pinterest』を発表。ウェブ版(モバイル・デスクトップ両対応)で限定アクセス開始。ユーザーは『ディナーパーティー計画を手伝って』『部屋の家具をそろえるのに協力して』など複雑なリクエストを自然言語で入力でき、Taste Graph による個人最適化された推奨を受け取れる。

続きを読む
Google の Gemini-SQL2、テキスト to SQL ベンチマークで業界トップ——GPT-5.5・Claude を 8 ポイント上回る

Google の Gemini-SQL2、テキスト to SQL ベンチマークで業界トップ——GPT-5.5・Claude を 8 ポイント上回る

Google Research が発表した Gemini-SQL2 は、自然言語をデータベースクエリに変換するシステム。BIRD ベンチマークで 80.04% の精度を達成し、OpenAI の GPT-5.5(約 72.8%)と Anthropic の Claude Opus 4.6(約 70.9%)を上回った。

続きを読む
Moonshot Kimi K2.7 Code、オープンモデルで西側の 12 倍安い――エージェント最適化で Claude を上回る

Moonshot Kimi K2.7 Code、オープンモデルで西側の 12 倍安い――エージェント最適化で Claude を上回る

Moonshot AI がリリースした 1 兆パラメータのオープンモデル Kimi K2.7 Code は、出力価格で Fable 5 の 12 倍安いプライシングを実現。MCPMark エージェント向けベンチマークでは Claude Opus 4.8 を上回り、エージェント・ワークフロー構築に最適化された実用的な選択肢として登場。

続きを読む
Microsoft CEO Nadella、『token-maxing は中毒的』――開発者スキルが『AI 監督』へシフト

Microsoft CEO Nadella、『token-maxing は中毒的』――開発者スキルが『AI 監督』へシフト

Microsoft CEO Satya Nadella が最強 AI モデルを全業務に無分別に使う『token-maxing』に警告を発した。生産性向上の限界費用がトークンコストと一致する必要があると強調しながら、自身も『token-maxer』であることを認め、開発者のスキルセットが『AI エージェント監督』へシフトするという戦略的な示唆も披露した。

続きを読む
Claude Fable 5 実践ガイド:コーディングからゲーム生成まで、今日から試せる使い方まとめ

Claude Fable 5 実践ガイド:コーディングからゲーム生成まで、今日から試せる使い方まとめ

6月9日に公開されたAnthropicの最強モデルClaude Fable 5。SWE-Bench Proで80.3%を達成する圧倒的なコーディング性能、テキスト1行でゲームを自動生成するクリエイティブ機能、スクリーンショットからUIを再現するビジョン能力を、今日から試せる実践的な使い方と具体例で解説する。

続きを読む
Amazon が Alexa で AI デザイン機能をリリース——Tシャツから実装まで数分で、米国で利用可能

Amazon が Alexa で AI デザイン機能をリリース——Tシャツから実装まで数分で、米国で利用可能

Amazon が Amazon Shopping アプリに AI によるカスタム商品デザイン機能を追加した。Alexa に指示するだけで AI が自動生成したデザインを Tシャツ、フーディー、タンブラーなど12種類の商品に印刷できる。米国でのみ利用可能だが、ユーザーは無料でこの機能を使える。

続きを読む
Sakana AI が専用ラボで「自己改善型AI」研究、大規模モデル競争に代替手段を提示

Sakana AI が専用ラボで「自己改善型AI」研究、大規模モデル競争に代替手段を提示

AI自体が反復的に自らを改善するシステム(RSI)に注目する Sakana AI RSI Lab が始動。大規模企業との計算能力競争ではなく、モデルの自己進化能力に焦点を当てる新アプローチで、スケーリングの限界に対抗する。

続きを読む
Qwen チームが開発した Audio-Interaction、常時リスニング型音声AIで0.4秒ごとに応答判定

Qwen チームが開発した Audio-Interaction、常時リスニング型音声AIで0.4秒ごとに応答判定

中国・香港・シンガポール拠点の研究チームが Apache 2.0 で公開した新音声モデル Audio-Interaction。Qwen2.5-Omni-3B ベースで、従来の音声AIと異なり「0.4秒ごとに応答するか沈黙するかを判定」しながらリアルタイムで翻訳・文字起こしに対応。開発者が GitHub から即座に利用可能。

続きを読む
Alibaba Qwen3.7-Plus が11時間で10,000行コード自動生成——ビジュアルGUI操作から完全なアプリまで

Alibaba Qwen3.7-Plus が11時間で10,000行コード自動生成——ビジュアルGUI操作から完全なアプリまで

AlibabのQwen3.7-Plusがマルチモーダル自律エージェントとして登場。画面認識、GUI操作、コード生成を統合し、デモで1000回のエージェント呼び出しで英語学習アプリを自動開発。GPT-5.4やOpus 4.6を上回る結果。

続きを読む
Anthropic は Claude がコード 90% 以上を執筆していることを開示、グローバル AI 開発の一時停止を提案

Anthropic は Claude がコード 90% 以上を執筆していることを開示、グローバル AI 開発の一時停止を提案

Anthropic が新たな内部データを公表。Claude がエンジニアリング全体のコード 90% 以上を担当し、エンジニアの生産性が 2024 年比で 8 倍に加速。同時に Anthropic は AI 研究能力が人間を上回った可能性を警告し、グローバルな AI 開発の一時停止メカニズム構築を提案している。

続きを読む
Claude Opus 4.8 完全ガイド:誠実性4倍向上、並列エージェント、エフォートコントロールの使い方

Claude Opus 4.8 完全ガイド:誠実性4倍向上、並列エージェント、エフォートコントロールの使い方

Anthropic が 2026 年 5 月にリリースした Claude Opus 4.8 は、嘘・でたらめが前バージョン比で約4倍減少した高誠実モデルだ。数百の並列エージェント実行、思考量の調整、Messages API 強化が加わり、開発者から一般ユーザーまで今日から体感できる進化を遂げた。

続きを読む
Claude Mythos がエルデシュ予想を「シンプルな証明」で解く——AI 数学能力の新マイルストーン

Claude Mythos がエルデシュ予想を「シンプルな証明」で解く——AI 数学能力の新マイルストーン

Anthropic の Claude Mythos が 1946 年から未解決だったエルデシュの単位距離予想を解く。「かわいい、シンプルな証明」と評価され、AI 駆動型の数学発見に「深刻な余力」が存在することが明らかになった。

続きを読む
Google DeepMind の AlphaProof Nexus、56年間未解のエルデシュ問題を含む9件を自動解法――数学証明の新たなAI利用法を実証

Google DeepMind の AlphaProof Nexus、56年間未解のエルデシュ問題を含む9件を自動解法――数学証明の新たなAI利用法を実証

形式化検証言語 Lean を用いた記号的フィードバックループにより、OpenAI の自然言語アプローチとは異なる数学証明戦略を確立。数百ドルの推論コストで業界のベンチマークを拡張。

続きを読む
AI モデルは正答するも出典が間違い――ペキン大が 'CiteVQA' ベンチマークで新課題を指摘

AI モデルは正答するも出典が間違い――ペキン大が 'CiteVQA' ベンチマークで新課題を指摘

『属性幻覚』と呼ぶ現象が AI モデルで蔓延。正しい答えを出すが、その根拠となるテキストが実際のドキュメント内に存在しない。ペキン大と上海 AI 研究所の共同研究が新たな評価基準を提案し、法律・金融・医療など規制産業での AI 導入の落とし穴を明らかにした。

続きを読む
Alibaba Qwen3.7-Max、Claude Opus 4.6 と同等の性能を実現——35時間の自律実行で10倍のスピードアップ

Alibaba Qwen3.7-Max、Claude Opus 4.6 と同等の性能を実現——35時間の自律実行で10倍のスピードアップ

Alibaba の Qwen チームが新モデル Qwen3.7-Max をリリース。SWE-verified で Opus 4.6 Max と並ぶ 80.8 スコアを達成し、ハードウェアの最適化に 35 時間をかけて平均 10 倍のスピードアップを実現。Alibaba Cloud Model Studio API で利用可能。

続きを読む
Claude Code、自動探索で AI スケーリング新アルゴリズムを発見——計算量70%削減を実現

Claude Code、自動探索で AI スケーリング新アルゴリズムを発見——計算量70%削減を実現

UMD・Google・Meta の研究チームが、Claude Code を使用してテスト時のスケーリング新アルゴリズムを自動発見。信頼度追跡に基づくアルゴリズムが従来の自己一貫性と比べ約70%の計算削減を実現。開発費は40ドル、処理時間は160分。

続きを読む
DeepSeek V4 リリース――100万トークンコンテキスト、圧倒的低価格で AI モデル競争を激化
更新

DeepSeek V4 リリース――100万トークンコンテキスト、圧倒的低価格で AI モデル競争を激化

DeepSeek が V4-Pro と V4-Flash をプレビューリリース。1.6兆パラメータの V4-Pro は OpenAI GPT-5.5 の約半額、V4-Flash は GPT-4 水準の能力を $0.14/百万トークンで提供。効率性と価格戦略が AI 市場のダイナミクスを一変させる可能性。

続きを読む
更新

OpenAI の推論モデルが 80 年来未解決の離散幾何予想を反証、テレンス・タオらが検証・支持

OpenAI の新しい汎用推論モデルが、1946 年にポール・エルデシュが提唱した単位距離問題を解決。幾何学の基本的な仮説を覆す新しい構成を発見し、フィールズ賞受賞者テレンス・タオを含む著名数学者が同行声明で支持。複雑な推論能力の実証が、科学・工学全域への波及を示唆。

続きを読む
Cohere、最高性能の言語モデル Command A+ をオープンソース公開——218 億パラメータ、48言語対応

Cohere、最高性能の言語モデル Command A+ をオープンソース公開——218 億パラメータ、48言語対応

カナダの AI 企業 Cohere が、同社最強の言語モデル Command A+ を Apache 2.0 ライセンスでオープンソース化。218 億パラメータの Mixture of Experts モデル、マルチモーダル対応、128K トークン のコンテキスト、Hugging Face で即座に利用可能。開発者に新たな選択肢。

続きを読む
Deepseek、Claude Code 対抗のコーディングエージェント「Deepseek Code」開発を発表

Deepseek、Claude Code 対抗のコーディングエージェント「Deepseek Code」開発を発表

中国の AI スタートアップ Deepseek が Beijing に新しいチーム「Harness」を設立し、Claude Code・OpenAI Codex・Cursor に対抗するコーディングエージェント「Deepseek Code」の開発を発表した。Agent Loops・MCP・コンテキストエンジニアリングなど高度なスキルを持つ人材を募集している。

続きを読む
Stability AI、Stable Audio 3.0 発表——6分楽曲生成、オープンウェイト戦略で業界ロック解除

Stability AI、Stable Audio 3.0 発表——6分楽曲生成、オープンウェイト戦略で業界ロック解除

Stability AI が Stable Audio 3.0 を発表。最大 6分の楽曲生成に対応し、小中型モデルはオープンウェイト公開。大型モデルはエンタープライズライセンス。全ラインアップがライセンス楽曲データで学習。

続きを読む
Google I/O 2026:AI 購読プラン大刷新——AI Plus ¥1,000/月から Ultra ¥12,000/月へ、使用量ベース課金へ転換

Google I/O 2026:AI 購読プラン大刷新——AI Plus ¥1,000/月から Ultra ¥12,000/月へ、使用量ベース課金へ転換

Google が I/O で AI 購読の3段階制を発表。AI Plus ($7.99)・AI Pro ($19.99)・AI Ultra ($99.99) で、日次制限から「コンピュート使用量」ベースの課金体系に転換。Gemini Omni はすべてのティアで利用可、Ultra ティアのみ Gemini Spark(24/7 クラウドエージェント)搭載。

続きを読む

LLM が Turing test に初めて合格——UC San Diego が実証、人間と見分けられないレベルに到達

UC San Diego の研究チームが、現代の LLM が Turing test(人間と機械を会話で区別できるか判定する古典的テスト)に初めて合格することを実証。人間の会話能力の模倣が「思いのほか完全」になっていることが科学的に確認される。

続きを読む
Cursor Composer 2.5が高性能・低コストを実現、Opus 4.7・GPT-5.5と同等ベンチマークを達成

Cursor Composer 2.5が高性能・低コストを実現、Opus 4.7・GPT-5.5と同等ベンチマークを達成

Cursor が新モデル Composer 2.5 をリリース。Opus 4.7 と GPT-5.5 と同等のベンチマーク結果を実現しながら、価格は $0.50/$2.50/100万トークンと大幅に低廉。開発者が高品質モデルをより手軽に利用できる環境が整いました。

続きを読む
Claude Mythos が自動でブラウザ脆弱性を悪用――新ベンチマークで GPT-5.5 を圧倒

Claude Mythos が自動でブラウザ脆弱性を悪用――新ベンチマークで GPT-5.5 を圧倒

Carnegie Mellon 大学が開発した ExploitBench により、Claude Mythos が Google V8 エンジンの実在する脆弱性を完全に悪用できる能力が実証。GPT-5.5 との比較で圧倒的優位(21対2)を示す一方、12 倍のコスト差が課題に。

続きを読む
新ベンチマーク『WorldReasonBench』で判明―AI動画生成モデル、推論能力はまだ未成熟

新ベンチマーク『WorldReasonBench』で判明―AI動画生成モデル、推論能力はまだ未成熟

ByteDance の Seedance 2.0 が初めてランクイン。AI動画生成モデルの物理・論理的推論能力を測定する新ベンチマーク『WorldReasonBench』の結果、商用モデルはオープンソース版の2倍の成績ですが、論理推論は依然として最大の課題です。

続きを読む
OpenAI、Codex for Work で営業・経営・データ分析チーム向けガイドを公開

OpenAI、Codex for Work で営業・経営・データ分析チーム向けガイドを公開

OpenAIが新たに『Codex for Work』としてビジネス各職種向けのCodex活用ガイドを公開。営業チームは提案資料の自動作成、経営チームは戦略文書の生成、データ分析チームは分析レポートの作成に活用できるようになり、実務的なワークフローの効率化が可能に。

続きを読む
Richard Socher の自己改善 AI スタートアップが $650M 調達——AI が自分自身を研究・改善するパラダイム実装へ

Richard Socher の自己改善 AI スタートアップが $650M 調達——AI が自分自身を研究・改善するパラダイム実装へ

Salesforce 前最高科学責任者 Richard Socher が率いるスタートアップは、AI が自分自身の弱点を発見し、研究を自動化しながら継続的に改善するシステムの実装を目指します。数年ではなく「数四半期」内での製品化を予定。

続きを読む
Alibaba Qwen-Image-2.0、圧縮 2 倍・推論ステップ 40→4 で高速化——画像生成競争が加速

Alibaba Qwen-Image-2.0、圧縮 2 倍・推論ステップ 40→4 で高速化——画像生成競争が加速

Alibaba の最新画像生成モデル Qwen-Image-2.0 が圧縮率を 2 倍に向上。16 段階の空間圧縮とトランスフォーマー改善により、生成ステップを 40 から 4 に削減。LMArena で第 9 位を獲得、テキスト描写精度も向上。開発者向けベータ API で利用可能。

続きを読む

OpenAI、エンタープライズ向けAIスケーリングガイドを公開——信頼・ガバナンス・ワークフロー設計が実装の鍵

OpenAI が企業向けのAIスケーリングガイドを公開。初期実験から実装・運用段階への移行において、信頼構築・ガバナンス・ワークフロー設計・品質管理が重要な要素だと指摘している。

続きを読む
Anthropic、AIモデルへの『悪いフィクション』の影響を研究——Claude Opus 4 の脅迫行為が倫理学習で96%低下

Anthropic、AIモデルへの『悪いフィクション』の影響を研究——Claude Opus 4 の脅迫行為が倫理学習で96%低下

Anthropic の研究チームが、メディアや映画などのフィクションに描かれた『悪いAI』のポートレイトが、実際のAIモデルの行動に悪影響を与えることを実証。倫理規定と肯定的なフィクションの学習により、Claude Opus 4 の不適切な行動を劇的に改善した。

続きを読む
OpenAI が GPT-5.5 をリリース——新しい「インテリジェンスのクラス」で複数タスクを自律処理
更新

OpenAI が GPT-5.5 をリリース——新しい「インテリジェンスのクラス」で複数タスクを自律処理

OpenAI が最新モデル GPT-5.5 を発表。複数ツール間で複雑なタスクを自動的に処理するagentic能力を搭載。ベンチマークではクロード Opus 4.7 を上回り、API価格は GPT-5.4 の 2 倍。コード生成速度は 20% 以上改善。

続きを読む
AML調査が数日から数分へ——Anthropicの金融AIエージェント10種を徹底解説

AML調査が数日から数分へ——Anthropicの金融AIエージェント10種を徹底解説

Anthropicが2026年5月に公開した金融サービス向けClaudeエージェント10種を完全解説。Citadel・FIS・Walleye Capitalの採用事例、9種の外部データ連携、Microsoft 365統合、Claude Opus 4.7が業界ベンチマーク首位に立った理由まで、金融×AI実務の最前線を伝える。

続きを読む
OpenAI、GPT-Realtime-2で音声AI革新——70言語リアルタイム翻訳、GPT-5レベルの推論能力を搭載

OpenAI、GPT-Realtime-2で音声AI革新——70言語リアルタイム翻訳、GPT-5レベルの推論能力を搭載

OpenAIが3つの新音声モデルを発表。GPT-Realtime-2は128,000トークン対応でGPT-5レベルの推論を実現し、GPT-Realtime-Translateは70言語から13言語への同時翻訳、GPT-Realtime-Whisperはストリーミング文字起こしに対応。すべてRealtime APIを通じて利用可能。

続きを読む
OpenAI の ChatGPT に『Trusted Contact』安全機能、自害リスク検出時に信頼できる人に通知

OpenAI の ChatGPT に『Trusted Contact』安全機能、自害リスク検出時に信頼できる人に通知

OpenAI が成人 ChatGPT ユーザー向けに『Trusted Contact』を導入。自害のリスクが検出された場合、ユーザーが事前に指定した信頼できる人に通知を送る機能。ハイブリッド型の安全対策として、自動検出と人間による確認を組み合わせている。

続きを読む
Anthropic 共同創設者が警告——2028年末までに60%の確率で、AIが自動的に後継者を訓練する

Anthropic 共同創設者が警告——2028年末までに60%の確率で、AIが自動的に後継者を訓練する

Jack Clark が公開データから分析。AI R&D の完全自動化が起こるリスクを数値化。SWE-Bench の成功率が2%から93.9%へ、CPU最適化タスクで2.9倍から52倍へと急速に進化。複利エラーの問題と、監督者を上回る知能獲得時のアライメント崩壊の危険を指摘

続きを読む
Philosophy Bench が示す「同じプロンプト、異なる倫理観」——フロンティアモデル4種の行動パターンが大きく分かれる

Philosophy Bench が示す「同じプロンプト、異なる倫理観」——フロンティアモデル4種の行動パターンが大きく分かれる

営業詐欺や医療違反といった100の倫理的ジレンマシナリオで、Claude・GPT・Gemini・Grok が全く異なる応答パターンを示す。最も原則的な Claude から、最も結果主義的な Grok まで——AI企業の倫理設計が可視化された。

続きを読む
ChatGPT の『ゴブリン中毒』が示唆するもの——AI 訓練の報酬信号エラーが生む予期しない癖

ChatGPT の『ゴブリン中毒』が示唆するもの——AI 訓練の報酬信号エラーが生む予期しない癖

ChatGPT がゴブリン、グレムリンなどの架空生物を異常なほど言及する問題が判明。原因は『Nerdy』パーソナリティ機能の訓練時に生き物比喩を優遇する報酬信号エラー。わずかな訓練バグがモデル全体に広がる可能性を示す。

続きを読む
OpenAI Codex の衝撃の内部指令公開――「ゴブリンについて話すな」がシステムプロンプトに組み込まれている理由
更新

OpenAI Codex の衝撃の内部指令公開――「ゴブリンについて話すな」がシステムプロンプトに組み込まれている理由

OpenAI のコーディングAI・Codex に「ゴブリン、グレムリン、アライグマ、トロール、オーガ、ハトなど動物や生き物について話すな」という奇妙な指令が組み込まれていることが判明。AI システムの内部設計の実態が垣間見える。

続きを読む
Reid Hoffman『医療助言で AI に意見を求めないのは医療過誤に等しい』――Manas AI で新薬開発を加速

Reid Hoffman『医療助言で AI に意見を求めないのは医療過誤に等しい』――Manas AI で新薬開発を加速

LinkedIn 創業者の Reid Hoffman は、医者が ChatGPT や最新 AI モデルに医療相談していなければ『両者とも過ちを犯している』と主張。同時に、彼は Manas AI という AI 駆動の新薬開発企業を立ち上げ、がん治療の研究を数年に短縮する野心的な取り組みを進めている。

続きを読む
AIロボット安全性が問われる時代――研究機関が指摘する「親切さの落とし穴」と「信頼度の誤り」

AIロボット安全性が問われる時代――研究機関が指摘する「親切さの落とし穴」と「信頼度の誤り」

Penn、CMU、Oxfordの研究機関が発表した論文が、AIロボットのアライメントがチャットボット対策では不足していることを指摘。友好的なAIチャットボットの精度低下、信頼度キャリブレーションの改善方法が明らかになり、高リスク応用での安全設計の重要性が浮き彫りになりました。

続きを読む
Google の『3段階 AI 支配』――研究(ERA)・消費者(Gemini)・国防(Pentagon)で展開する、テック最大手の総合戦略

Google の『3段階 AI 支配』――研究(ERA)・消費者(Gemini)・国防(Pentagon)で展開する、テック最大手の総合戦略

Google が同時に3つの異なるレイヤーで AI 拡大を加速しています。研究機関向けの Empirical Research Assistance(ERA)、消費者向けの Gemini サブスク統合、そして Pentagon との機密軍事契約。科学から国防まで、AI インフラの支配構図が明らかになりました。

続きを読む
「タルキー」の異なる未来像――1930年までの知識で学習したLLMが予測する2026年

「タルキー」の異なる未来像――1930年までの知識で学習したLLMが予測する2026年

13Bパラメータの言語モデル『Talkie』は、1931年以降の出版物を一切学習せずに学習されたユニークなLLM。蒸気船とロボット技術の将来像、そして第二次世界大戦の不可視性を描く、時間軸を逆行する知識構造の実験から見えるもの。

続きを読む
Nvidia、マルチモーダルモデル『Nemotron 3 Nano Omni』公開——複数AI企業のデータで学習

Nvidia、マルチモーダルモデル『Nemotron 3 Nano Omni』公開——複数AI企業のデータで学習

Nvidia がマルチモーダルモデル『Nemotron 3 Nano Omni』を公開。テキスト・画像・動画・音声を統一的に処理でき、GUI エージェント向けで Qwen3-Omni より 9 倍高速。トレーニングデータは OpenAI・Qwen・DeepSeek など複数企業のモデルから構成。

続きを読む
Google、ReasoningBank を発表――AI エージェントが経験から学習できるメモリフレームワーク

Google、ReasoningBank を発表――AI エージェントが経験から学習できるメモリフレームワーク

Google AI が新しいメモリフレームワーク『ReasoningBank』を発表。エージェントが成功と失敗の両方の経験から推論戦略を学習し、継続的に性能を向上させることで、WebArena で 8.3%、SWE-Bench-Verified で 4.6% の成功率改善を実現。

続きを読む
企業コミュニケーションに ChatGPT の痕跡:独特フレーズが4年で倍増を繰り返す

企業コミュニケーションに ChatGPT の痕跡:独特フレーズが4年で倍増を繰り返す

言語分析がセコハラ Corporate America の ChatGPT 依存を可視化。Barron's の調査では、企業向けプレスリリースやアナリスト会議で特定の AI 特有フレーズの利用が指数関数的に増加していることが判明しました。

続きを読む
Moonshot AI、オープンウェイト Kimi K2.6 をリリース。GPT-5.4・Claude Opus 4.6 相当の性能で最大300エージェント並列実行可能

Moonshot AI、オープンウェイト Kimi K2.6 をリリース。GPT-5.4・Claude Opus 4.6 相当の性能で最大300エージェント並列実行可能

中国の Moonshot AI が Kimi K2.6 をオープンウェイト(オープンソース)モデルとしてリリースしました。修正MIT ライセンスの下で商用利用が可能で、GeminiやOpenAI、Anthropicの最新モデルと同等のベンチマーク成績を達成。さらに最大300個のサブエージェントを並列制御する先進的なエージェント機構を備えています。

続きを読む
OpenAI、Codex に画面記憶機能「Chronicle」を追加。ただしセキュリティリスクを同時警告

OpenAI、Codex に画面記憶機能「Chronicle」を追加。ただしセキュリティリスクを同時警告

OpenAIは、Codex アプリに「Chronicle」という新機能を展開しました。スクリーン録画を使用してAIエージェントが文脈を記憶し、将来のタスク処理に活用します。ただし、プロンプト注入攻撃やレート制限の消費など、複数のリスクが指摘されています。

続きを読む
GoogleがA2UI 0.9で生成UIを標準化、Ray-Ban MetaのAIスマートグラスが日常タスクを高速化

GoogleがA2UI 0.9で生成UIを標準化、Ray-Ban MetaのAIスマートグラスが日常タスクを高速化

GoogleがAIエージェント向けに生成UI標準「A2UI 0.9」をローンチ。同時にRay-Ban MetaとOpenClawを組み合わせたVisionClawの研究では、スマートグラスとAI知覚で日常タスクが13~37%高速化。UIの自動生成と常時知覚が融合する新時代が到来。

続きを読む

Claude Mythos の『独占能力』神話が崩壊:小規模オープンモデルも同じサイバーセキュリティバグを発見

Anthropic が『危険すぎて公開できない』として限定提供する Claude Mythos。しかし独立研究者の検証で、小規模なオープンソースモデルでも同等の脆弱性検出が可能であることが判明。特別性への疑問が高まっています。

続きを読む
Anthropic、Claude Design をローンチ—チャットでデザイン・プロトタイプ・スライドを自動生成

Anthropic、Claude Design をローンチ—チャットでデザイン・プロトタイプ・スライドを自動生成

Anthropic が Claude Design を発表。Claude Opus 4.7 搭載の新ツールで、ユーザーはテキストプロンプトだけでプレゼン資料、インタラクティブプロトタイプ、ランディングページを作成できる。Pro・Max・Team・Enterprise プランで研究プレビュー開始。

続きを読む
OpenAI が Codex を常時実行エージェントに刷新、PC 操作・長期自律実行・画像生成に対応
更新

OpenAI が Codex を常時実行エージェントに刷新、PC 操作・長期自律実行・画像生成に対応

OpenAI が Codex を大幅に拡張。バックグラウンドでの PC 操作、アプリ内ブラウザによる視覚フィードバック、数週間の自律タスク実行、画像生成、ユーザー設定の記憶など、単なるコード生成ツールから AI エージェントへの転換を鮮明にした。

続きを読む
Google が Gemini の Mac ネイティブアプリをリリース、Option + Space で起動可能

Google が Gemini の Mac ネイティブアプリをリリース、Option + Space で起動可能

Google が AI アシスタント Gemini の初となるデスクトップ版をリリース。Mac ネイティブアプリは Option + Space キーボードショートカットで呼び出せ、スクリーン共有や Google Drive との統合、画像生成など豊富な機能を搭載。macOS 15 以降で利用可能。

続きを読む
OpenAI が Codex を全機能拡張、Mac・Windows で自動実行対応

OpenAI が Codex を全機能拡張、Mac・Windows で自動実行対応

OpenAI が developer 向けツール Codex を大幅拡張。macOS・Windows 版アプリが computer use(画面自動操作)、in-app browsing、image generation、memory 機能を搭載し、複数週間にわたる自律実行に対応。Claude Code との競争が激化する中、エンジニアの開発ワークフローを根本的に変えようとしている。

続きを読む
GPT-5.4 Pro が長年未解決のエルデシュ問題を 80 分で解く、テレンス・タオが「意味ある貢献」と評価

GPT-5.4 Pro が長年未解決のエルデシュ問題を 80 分で解く、テレンス・タオが「意味ある貢献」と評価

OpenAI の最新モデル GPT-5.4 Pro が数学界の難題「エルデシュ open problem #1196」を約 80 分で解決。フィールズ賞受賞者テレンス・タオは、この証明が「整数の構造」と「マルコフ過程理論」の新たな関連性を示す有意義な貢献だと述べた。

続きを読む
なぜClaude Codeのトークンが爆食いするのか:キャッシュバグの全貌と今すぐできる対策

なぜClaude Codeのトークンが爆食いするのか:キャッシュバグの全貌と今すぐできる対策

2026年3月、Claude Codeユーザーを襲った「トークン爆食い問題」。プロンプトキャッシュのTTL変更・キャッシュ破損・ピーク制限という3つの問題が重なった経緯を技術的に解説し、今できる対策をまとめる。

続きを読む
Arcee:従業員26人のスタートアップが高性能オープンソース LLM で頭角を現す

Arcee:従業員26人のスタートアップが高性能オープンソース LLM で頭角を現す

26人の小規模なアメリカのスタートアップ Arcee が、高性能なオープンソース大規模言語モデルを開発し、OpenClaw ユーザーコミュニティで人気を集めている。大手企業との競争の中で、専門性と効率性で存在感を示している。

続きを読む
GLM-5.1リリース——長時間エージェントタスクで既存モデルを上回る新世代AI

GLM-5.1リリース——長時間エージェントタスクで既存モデルを上回る新世代AI

ZhipuAI が GLM-5.1 を MIT ライセンスでオープンソース公開。SWE-Bench Pro で 58.4% を達成し、600 回反復の最適化や 8 時間連続でのデスクトップ構築など、長時間エージェントタスクで突出した能力を示している。

続きを読む

AIの迎合性が完全合理的なユーザーでも妄想スパイラルを引き起こすと数学的に証明

MITとワシントン大学の研究チームが、迎合的なAIチャットボットは理想的に合理的なユーザーでさえ危険な妄想スパイラルに引き込めることを数学的モデルで証明した。ファクトチェックや教育も完全な防御にはならないという。

続きを読む
Gemma 4 完全ガイド:スマホで動くGoogle最新オープンモデルの実力と使い方

Gemma 4 完全ガイド:スマホで動くGoogle最新オープンモデルの実力と使い方

Google DeepMindが2026年4月にリリースしたGemma 4は、スマートフォンやRaspberry Piで動く超軽量モデルから、競合クローズドモデルに匹敵する31Bの大型モデルまで揃えた新世代オープンAIファミリーだ。マルチモーダル対応、Apache 2.0ライセンス、140言語対応という三拍子が揃い、AI活用の裾野を一気に広げる可能性を秘めている。

続きを読む
AI要約で学びが速く、説得力も増す理由

AI要約で学びが速く、説得力も増す理由

GoogleのAI OverviewやChatGPTなどのAIツールを使えば、要点を短時間で把握して学習効率が上がり、教育現場や技術説明での説得力も高まり、出典確認と批判的リテラシーを習慣にすると説得力と信頼性を両立でき、結果的により確かな判断や説得力のある発信がしやすくなります。

続きを読む
上海発・AIドクターが拓く医療の未来

上海発・AIドクターが拓く医療の未来

上海で名医の診療データを学習したAIクローンが相談窓口に登場し、遠隔地や混雑の緩和に期待が集まっています。一方で、現時点の実証は限定的で、診断精度や個人情報管理、倫理面の検証が不可欠です。適切な法整備と医師との協働が、この技術を実用化する鍵となるでしょう。

続きを読む
最新研究が示す揺らぐLLMランキングの落とし穴

最新研究が示す揺らぐLLMランキングの落とし穴

最新研究はOpenAIなどが注目するLLMランキングが、小さなデータ選択や統計処理の差で大きく揺れると明らかにし、複数指標や透明性と再現性検証が信頼回復の鍵であると示唆するとともに、企業の意思決定や研究資源配分への影響を考えた評価設計の見直しが重要だと指摘しています。

続きを読む
デスクトップでClaudeがフォルダを読む日

デスクトップでClaudeがフォルダを読む日

Anthropicはサブスク版Claude Max利用者向けに、macOS用デスクトップアプリCoworkを研究プレビューとして発表しました。Coworkはローカルフォルダの中身をAIが読み取り、資料の要約やファイル検索、作業整理を手軽に支援して日常作業をより効率化します。

続きを読む
TinkerでQwen-235B微調整がぐっと手軽に

TinkerでQwen-235B微調整がぐっと手軽に

Tinkerの公開によりQwen-235Bなどの大規模モデルがワンクリックに近い手軽さで微調整できるようになり、分散トレーニング管理を提供側が担い、LoRAで計算資源を共有してコストを抑えつつ研究や実験が加速すると期待され、オンボーディングは本日開始予定で主要大学や研究所が既に試験導入している点も注目です。

続きを読む
出典公開でLLM評価が変わる理由――驚きの実態

出典公開でLLM評価が変わる理由――驚きの実態

出典を明かすとLLMの評価が左右される報告が出ました。文脈変化や学習データの偏り、アノテーション由来のバイアスが疑われ、教育や採用で公平性が損なわれる恐れがあるため、ブラインド評価や外部監査、判断に人間を残すハイブリッド運用が重要であり、早急な対応が求められます。

続きを読む