Grok 4.5 一般公開、Cursor データで訓練も『自己申告ベンチマーク』に懐疑の声
SpaceXAI(旧xAI)が Grok 4.5 を一般公開しました。Cursor の実開発セッションを学習に取り込み、Harvey 法律ベンチマークで1位を獲得。価格は入力$2/出力$6(100万トークンあたり)と Opus 4.8 の半分以下ですが、独立系ベンチマークでの検証はまだなく、Cursor ユーザーのコードが無断で学習に使われた可能性も指摘されています。
続きを読む全4036件の記事から 231-253件目を表示中
SpaceXAI(旧xAI)が Grok 4.5 を一般公開しました。Cursor の実開発セッションを学習に取り込み、Harvey 法律ベンチマークで1位を獲得。価格は入力$2/出力$6(100万トークンあたり)と Opus 4.8 の半分以下ですが、独立系ベンチマークでの検証はまだなく、Cursor ユーザーのコードが無断で学習に使われた可能性も指摘されています。
続きを読む中国の AI スタートアップ MiniMax が、2.7 兆パラメータの大規模言語モデルをオープンソース化することを発表。現在のフラッグシップモデル M3(4,280 億パラメータ)の 6 倍超となる本モデルは、2026 年内のリリースを予定。複雑な推論・多段階指示タスクでの性能向上が期待される一方、中国政府の規制強化が展開に影響する可能性もあります。
続きを読むMeta Superintelligence Labsが新しい画像生成モデル『Muse Image』を発表。テキストプロンプトからの画像生成、広告制作支援、Instagram Stories向けAIエフェクトなど複数の用途で提供される。クリエイターと一般ユーザーが今すぐ試せるツール。
続きを読むGoogle Deepmind は Gemini API の Managed Agents に 4 つの新機能を追加。バックグラウンド実行(非同期)、リモート MCP サーバー接続、カスタム関数の統合、認証情報のリフレッシュを実現。開発者は HTTP 接続を保持せずにエージェントを運用できるように
続きを読むFuture of Life Institute が 9 つの主要 AI 企業を安全性で評価。Anthropic が最高スコア(C+)を獲得しながらも、業界全体で『存在的リスク』への対応が不十分。9 企業すべてが A 評価を取得できず、AI 規制・監視の課題が浮き彫りに。
続きを読むMeta がテスト中の AI グラス『Super Sensing』は、カメラ・マイクで常時周囲を記録しながら、LED インジケータが点灯しないため、撮影者に気付かれない設計。収集映像を Meta AI モデル訓練に利用する計画も明らかになり、プライバシー及び GDPR 対応への懸念が急速に高まっています。
続きを読むオープンソース LLM で知られる Mistral AI が、ロボティクス市場に本格参入。8 億パラメータの『Robostral Navigate』は単一 RGB カメラのみで複雑環境での自律航行を実現。79.4% の成功率でベンチマーク達成。シミュレーション訓練からの実装、RL による継続的改善を計画。
続きを読むGrok を使用した CSAM 製造事件で、男性が継娘の写真から 7000 枚以上の児童性的虐待画像を製造。xAI は大半の違反報告を放置していたとして、複数の少女が X を相手取った訴訟へ発展。セキュリティ・法的責任の深刻な問題が再浮上。
続きを読むトランプ政権の国家サイバーセキュリティ部門と科学技術政策局の要求を受け、OpenAI が新型モデル GPT 5.6 の段階的デプロイメント戦略に切り替え。政府による AI モデルリリース審査の流れが本格化。
続きを読むOpenAI が新音声モデル GPT-Live-1 をリリース。フルデュプレックス技術により、ユーザーは話しながら AI に割り込まれ、30~40 分の長時間会話に対応。ChatGPT 無料ユーザーは GPT-Live-1 mini、有料ユーザーは GPT-Live-1 フル版が利用可能。7 月中に API アクセスも予定。
続きを読むArtificial Analysis の新ベンチマークで、Claude Fable 5 が財務・法律・医療など6つの業界別インデックス全てでトップを獲得。しかし Strategy & Ops インデックスでは Fable 5 は 1タスクあたり $3.48 に対し DeepSeek V4 Pro は $0.03、100倍以上のコスト差が判明。企業の導入判断が価格と性能のバランスで揺れている。
続きを読むセキュリティ研究者が新たな脅威『HalluSquatting』を発見。LLMが『わかりません』と答えられない性質を悪用し、ハッカーが9つの主要AIツール(ChatGPT、Claude、Gemini など)を通じて大規模ボットネットを組み立てられる危険性が判明。企業のセキュリティ態勢に新たな課題。
続きを読むYann LeCun が支持するフランスのスタートアップ ZML が、複数チップに対応した推論最適化ツール ZML/LLMD を無料でリリース。AI 実装の民主化を目指す。
続きを読むGoogle Research が Google Maps の AI 経路最適化アルゴリズムを改善し、6 ヶ月間のテストで時速 2% の向上と燃料消費 0.5〜1.0% の削減を実現。ピーク時間帯で 0.5% の改善を確認し、年間数千トンの CO2e 削減の可能性を示唆。
続きを読むHarvard 研究チームが開発したフレームワーク Orla は、複数の AI モデルの実行を自動で最適化し、計算コスト・応答時間・精度を同時に改善。ACM Conference で発表された、スケーラブルな AI ワークフロー管理の新手法。
続きを読む米防衛技術企業Forterraが開発した自律走行ATV『Lancer』をウクライナ軍に配備。2,500マイル以上の走行実績と77万トン超の物資輸送を記録し、戦場での自動ロジスティクスを現実化させた。
続きを読むトップロボット工学研究者とスタートアップ創業者らが、AIがいかにロボット自律性を加速させているかを語った。単機能ロボットの時代は終わり、様々な環境と任務に対応する『汎用自律ロボット』への転換が始まっている。
続きを読むAR スマートグラスに搭載されたカメラをカバーできる物理シールド機能。撮影状態を一目で判定でき、プライバシー意識の高いユーザーには『選択肢』となるが、同時に監視テクノロジーの主流化への警告でもある。
続きを読むOpenAI が発表した GPT-5.6 は、フラグシップの Sol、バランス型の Terra、コスト重視の Luna という3階層構成を採用。Max モードや Ultra モードの新機能、Claude Mythos 5 との性能比較、価格設定まで、開発者が知るべきすべてを解説する。
続きを読む決済企業 Australian Payments Plus が、ChatGPT Enterprise と Codex を活用して支払い処理ワークフローを高速化・効率化したケーススタディを公開。処理時間短縮、品質向上、人間の判断を中心に保つ仕組みをバランスさせた実装例。
続きを読むCohere が20億パラメータのオープンソース音声認識モデル『Cohere Transcribe Arabic』を発表。Apache 2.0ライセンスで Hugging Face に公開。Whisper と比べて方言・コード混在・アラビア英語混交に対応。開発者が自由に活用・改善できる。
続きを読むテック大手が掲げたカーボンニュートラル達成は幻想になりつつある。AI データセンターの電力需要が目標達成を不可能に近づけ、Google・Amazon は誓約の見直し、Meta は代替案模索を余儀なくされている。
続きを読むAI ブームが生み出したデータセンター建設ラッシュが、米国北東部の製造業者に直結している。電力不足と電気代高騰で、Rust Belt の産業復興を掲げる Trump 政策と、AI インフラ投資が競合する状況が生まれた。
続きを読む