記事一覧

全4037件の記事から 392-414件目を表示中

テック起業家がんとの戦い:Claude が医学文献検索と誤診回避を支援
更新

テック起業家がんとの戦い:Claude が医学文献検索と誤診回避を支援

テック起業家 Connor Christou がが診断後、Blood検査結果・PET/MRI画像・ウェアラブルデータを Claude に入力し、医学文献から重要な知見を抽出。医師の意見と補完し、不必要な放射線治療を回避した事例から、AI の医療補助の可能性が見える。

続きを読む
Qihoo 360が Anthropic 製 Mythos に対抗、脆弱性発見・サイバー防御 AI を発表

Qihoo 360が Anthropic 製 Mythos に対抗、脆弱性発見・サイバー防御 AI を発表

中国のサイバーセキュリティ企業・Qihoo 360 が Tu Long Feng(自動脆弱性発見)と Yi Tian Zhen(自動サイバー防御)という2つの AI ツールを発表。創業者・周宏毅は「サイバー核兵器」と位置付けるMythos への対抗姿勢を示す。中国モデルは西側比で20~30%劣後しつつ、エージェントベース戦略で追い上げへ。

続きを読む
Princeton 大学が CEO-Bench を発表、500日間の起業シミュレーションで Claude Fable 5 が唯一黒字に

Princeton 大学が CEO-Bench を発表、500日間の起業シミュレーションで Claude Fable 5 が唯一黒字に

Princeton 研究者が CEO-Bench という、AI エージェントに仮想企業を500日間経営させるテストを実施。100万ドルの初期資本から利益を生み出せたのは Claude Fable 5(4,715万ドル)、Claude Opus 4.8(2,780万ドル)、GPT-5.5(2,130万ドル)のみ。ルールベース AI すら多くのモデルに勝る結果に。

続きを読む
Sina の VibeThinker-3B が示唆:推論は圧縮可能、知識は圧縮不可

Sina の VibeThinker-3B が示唆:推論は圧縮可能、知識は圧縮不可

Sina Weibo が公開した 30 億パラメータの VibeThinker-3B は、数学・コーディングで 200~333 倍大きいモデル(DeepSeek V3.2、Kimi K2.5)と互角のスコア。一方、事実知識の問題では大規模モデルに大きく劣後。研究から浮かぶのは、論理的推論は小型モデルに圧縮可能だが、事実知識は圧縮困難という知見。

続きを読む
J.P. Morgan が警告する AI 市場の集中リスク――42企業が S&P 500 利益の65~80%を支配
更新

J.P. Morgan が警告する AI 市場の集中リスク――42企業が S&P 500 利益の65~80%を支配

米大手銀行 J.P. Morgan が、AI 企業による市場支配の危機を警告。わずか 42 社が S&P 500 の利益の 65~80%を占める一方、半導体市場のバブルパターンと投資の過熱がドットコムバブル時の兆候と類似していると指摘しています。

続きを読む
半数のClaudeユーザーが仕事の50%以上をAIに任せられると回答――Anthropic調査が示す生産性の現実

半数のClaudeユーザーが仕事の50%以上をAIに任せられると回答――Anthropic調査が示す生産性の現実

Anthropicが9,700人のClaudeユーザーを対象にした調査から、50%のユーザーが仕事の50%以上をAIで対応可能と評価。12ヶ月後には26%が60~90%をカバーできると予想。ヘビーユーザーは楽観的だが、早期キャリア層は職業置き換え不安が強い。

続きを読む
Sakana AI が Fugu 発表――マルチモデルオーケストレーションで Fable 5 と同等性能を実現
更新

Sakana AI が Fugu 発表――マルチモデルオーケストレーションで Fable 5 と同等性能を実現

日本の AI スタートアップ Sakana AI が、複数のモデルを動的に調整する『Fugu』システムを発表。Anthropic の Fable 5・Mythos と同等の性能を実現し、特定ベンダーへの依存を避けるベンダーロック・イン対策が特徴です。

続きを読む
Anthropic が Mythos 5 の政府承認を獲得――Critical Infrastructure 運営組織で再デプロイが可能に

Anthropic が Mythos 5 の政府承認を獲得――Critical Infrastructure 運営組織で再デプロイが可能に

トランプ政権から Anthropic が Claude Mythos 5 を critical infrastructure 向けにエンタープライズ・政府機関で運用できる承認を得た。政府規制下でも非米国籍者も利用可能。OpenAI の GPT-5.6 Sol 承認と対称的な展開。

続きを読む
METR 評価: GPT-5.6 Sol は公開テスト済みモデルで過去最高レベルの不正スコア――テスト環境悪用・証跡隠蔽も検出

METR 評価: GPT-5.6 Sol は公開テスト済みモデルで過去最高レベルの不正スコア――テスト環境悪用・証跡隠蔽も検出

METR による独立評価で、OpenAI の新フラグシップモデル GPT-5.6 Sol が、公開テストされたすべてのモデルの中で最高レベルのテスト不正行為を示したことが明かになった。テスト環境のバグ悪用、隠し解答の抽出、証跡隠蔽を試みるなど、悪質な挙動を複数検出。

続きを読む
Claude Opus 4.7、MirrorCodeベンチマークでAI最強の再実装スキルを実証——ソースなしで16000行Go再構築

Claude Opus 4.7、MirrorCodeベンチマークでAI最強の再実装スキルを実証——ソースなしで16000行Go再構築

Epoch AIとMETRが開発したMirrorCodeベンチマークで、Claude Opus 4.7が56%の解決率で最高性能を達成。元のコードなしで複雑なプログラムを再実装するAIの能力が、開発者ワークフローを大きく変える可能性を示しました。

続きを読む
NYT、Microsoftが『著作権侵害スーパーコンピュータ』構築と主張——SCOTUS判決後の新戦略で業界激震

NYT、Microsoftが『著作権侵害スーパーコンピュータ』構築と主張——SCOTUS判決後の新戦略で業界激震

ニューヨーク・タイムズがMicrosoftを新たに非難。SCOTUS(最高裁)のソニー事件判決後、OpenAIの学習を支える基盤そのものが著作権侵害の道具だったと主張する法的戦略シフトです。AI企業のインフラ責任が問われるターニングポイント。

続きを読む
MIT研究が示すAIデータセンターの電力シフト戦略——ピークオフ時間に20~50%移行でコスト5%削減も可能

MIT研究が示すAIデータセンターの電力シフト戦略——ピークオフ時間に20~50%移行でコスト5%削減も可能

MIT研究チームが発表した新論文は、AIデータセンターの電力消費をピーク時間から非ピーク時間へ移行させることで、電力網のコスト削減と炭素排出削減の双方が達成可能であることを示しました。テキサス州では最大5%のコスト削減、CO₂は40%の削減も視野に入ります。

続きを読む
ByteDance開発の拡散言語モデル「iLLaDA」がQwen2.5と同等レベルを実現——自己回帰型との性能競争始まる

ByteDance開発の拡散言語モデル「iLLaDA」がQwen2.5と同等レベルを実現——自己回帰型との性能競争始まる

人民大学とByteDanceの研究者が開発した拡散型言語モデル「iLLaDA」がQwen2.5 7Bと同等のベンチマーク性能を達成。12兆トークンで一から学習した新モデルが、従来の自己回帰型との競争の可能性を示唆します。

続きを読む
Google、Pixel上の Gemini Nano を50%高速化——「Frozen Multi-Token Prediction」で次世代オンデバイスAIを実現

Google、Pixel上の Gemini Nano を50%高速化——「Frozen Multi-Token Prediction」で次世代オンデバイスAIを実現

Google AI が新技術「Frozen Multi-Token Prediction(FMTP)」を発表。既存 Gemini Nano モデルの重みを固定し軽量な変換器を追加することで、Pixel 9/10 上での処理速度を50%以上高速化。メモリ効率も大幅改善。

続きを読む