プロフェッショナルサービス大手の KPMG が、AI を活用して執筆した報告書「Redefining excellence in the age of agentic AI」を撤回した。複数の大企業から虚偽・誤導的な記述を指摘されたためだ。この事例は、企業が AI で重要な報告書を作成する際の落とし穴を浮き彫りにしている。

撤回に至るまで

KPMG は 2025 年 10 月、AI エージェント時代の組織運営に関する報告書を発表した。報告書作成プロセスで AI ツールを活用していたが、複数の組織が発表後、自社についての記述が「虚偽または誤導的」だと指摘した。

指摘した企業には以下が含まれる:

  • UBS(スイス金融大手)
  • NHS(英国国民保健サービス)
  • スイス連邦鉄道
  • ロンドン交通局

各社は、報告書の中で自分たちの AI 利用状況が誤った形で説明されていたと述べた。KPMG はこうした指摘を受け、報告書の信頼性が損なわれたと判断し、撤回を決定した。

AI 幻覚が生成した虚偽

AI の生成プロセスでは「幻覚」と呼ばれる現象が発生する。モデルが学習データに基づき、もっともらしいが実際には存在しない情報を生成してしまうのだ。

KPMG の報告書では、この幻覚が顧客企業の実際の AI 運用状況について、確認されていない情報を記述した。例えば「X 企業は AI でコスト削減に成功した」といった具体的な事例が、実際には存在しなかったり、企業の認識と異なっていたりした可能性が高い。

検証プロセスの欠落

KPMG の大きな誤りは、「AI が生成したコンテンツについて、独立した情報源で十分に検証しなかった」という点だ。報告書作成に関わった職員も、AI の出力をそのまま採用してしまったと考えられる。

これは、次の 2 つの責任区分の曖昧さを示している:

  • AI の出力責任:モデルが虚偽を生成した責任は誰が負うのか
  • 人間の検証責任:それを採用した組織の責任は

業界への教訓

KPMG の事例から、以下の教訓が導き出される:

  1. 企業報告書に AI は不向き — 事実確認が絶対的に必要な文書では、AI 生成コンテンツは補助的な役割に限定すべき
  2. 複数段階の検証が必須 — AI の出力について、独立した情報源による二重・三重の確認が必要
  3. 信頼の喪失コスト — 一度信頼が傷つくと、回復に多大な時間と投資が必要

KPMG 自身も声明で「すべての職員が AI の責任ある使用に関するガイドラインに従い、コンテンツ検証と独立した情報源の確認の人的監視を期待する」と述べており、今後の内部ガイドライン強化を示唆している。

AI が企業活動に深く入り込む中、単なる「効率化ツール」ではなく「検証が必須のリスク」として扱う姿勢が、企業に求められている。

アップデート:「二次的幻覚」という新しい危険性

KPMG の事例から新たに浮かび上がってきた概念が「secondary hallucinations(二次的幻覚)」だ。AI 検証企業 GPTZero の CEO Edward Tian はこれを警告している。

二次的幻覚とは、信頼度の高い企業から発表された誤った情報が、さらに AI システムや大衆メディアを通じて増幅・拡散される現象を指す。大手コンサルティング企業のような「信頼できる情報源」から出た虚偽が、その信頼性ゆえに広く引用され、さらに他の AI システムの学習データに混入される。結果として、誤情報が業界全体に波及するリスクが存在するのだ。

KPMG のケースは、この二次的幻覚の典型例となった。コンサルティング大手という社会的信用度から、報告書に含まれた虚偽がそのまま受け入れられ、複数企業が被害を受けた。現在、金融・医療・法律などの信頼が重要な領域では、この二次的幻覚のリスクが顕在化しはじめている。

企業が AI で重要な報告書や発表を作成する際には、単なる「AI 出力の検証」だけでなく、「その誤情報が業界全体に波及するリスク」まで考慮する必要があるということだ。

アップデート:Big Four 全社がAI生成レポート問題に直面、「Vibe Citing」が業界リスクに浮上(2026-07-29)

2026年7月29日、AI検証企業 GPTZero が詳細な調査報告を発表し、大手会計事務所「Big Four」の全 4 社がAI生成による幻覚と虚偽参照に悩まされていることが判明した。

Big Four に波及した AI hallucination

KPMG の事例発覚後、業界内で類似の問題がさらに浮かび上がった:

企業問題内容影響
KPMG複数のコンサルティングレポートで AI 幻覚2026年6月に報告書撤回
PwCMiddle East の4つの報告書で AI 生成率 84%(一部)「Citizen Pulse」プロダクト虚偽宣伝
Deloitte Australia複数報告書で虚偽・不正引用顧客信頼に影響
Ernst & YoungAI生成コンテンツの検証不足ブランド評判に傷

新概念「Vibe Citing」が浮かび上がった

GPTZero の分析で、これら報告書に共通する特異なパターンが「Vibe Citing」と命名された。

Vibe Citing とは

  • AI が生成した参照文献が、実際には存在しない、または完全に関連のないもの
  • 参照のタイトル・URL・著者が不正確であり、主張を裏付ける根拠を持たない
  • 外見上は「もっともらしい引用」に見えるが、実際には根拠のない造語

PwC の具体例: 「Citizen Pulse」というプロダクトについて、デンマーク・サウジアラビア・米国・オーストラリアの政府が利用していると主張。しかし、GPTZero がこれらの国の公式情報源を調査したところ「証拠が一切なかった」。AI がもっともらしい国名を列挙して「引用」を仮装していたのだ。

業界規模での危険性

KPMG 時点では「一企業の問題」と見なされていたが、Big Four 全社が同様の問題を抱えていたことで、以下の懸念が顕在化した:

  1. 顧客企業への直接的な害:コンサルティング大手の報告書は、経営戦略・M&A・デジタル変革の意思決定に使用される。虚偽が混入すれば、数百億円規模の経営判断が狂う可能性
  2. 供給チェーンリスク:「Big Four のような信頼できる機関が発表した情報」として、その虚偽がさらに他企業の AI 学習データに流入。二次的・三次的な幻覚の源泉になる
  3. 規制当局への報告義務違反:金融機関が提供するコンプライアンスレポートや監査報告書に AI 幻覚が混入していた場合、規制違反になりうる

対抗技術の登場:Pangram による AI 検出

この状況に対応して、AI 検出企業 Pangram が $9M の資金調達を完了し、新型 AI 検出モデル「Pangram 4」をリリースした。

Pangram 4 の仕様

  • テキスト検出精度:99.66% で AI 支援テキストを検出(AI 人間化ツールにも対応)
  • 誤検識率:24,000 文書中 1 件の誤検知率
  • 価格体系:Web月額$20、API は企業向けカスタム価格(従来比 2~10倍の値上げ)

Pangram は Substack・Quora・出版社・採用担当者など複数顧客に検出サービスを提供しており、「Big Four 品質の虚偽検出」をミッションとしている。

企業の対応と業界への含意

各社の対応:

  • PwC:「限定的な引用の更新を検討中」(詳細な発生経緯の公表なし)
  • Deloitte Australia:同様の内部調査を進行中
  • Ernst & Young:公式コメント未発表

業界全体への影響は深刻だ。コンサルティング企業が「AI で効率化した報告書」を顧客に提供する際、その虚偽性をどう保証するか——単なる企業ガバナンスの問題ではなく、デジタル時代の「情報の信頼性」そのものが問われている。