本文重點
- 「AI 會原封不動引用 FAQ」這一通說的實測結果
- Web 搜尋的啟動率在各 AI 服務間有多大差異
- 撰寫 FAQ 之意義的準確定位
結論
在 150 則回應中,能夠進行逐字比對的 120 則回應裡,與 FAQ 文句的逐字一致為零,接近的改寫亦為零。搜尋的啟動率依服務不同從 0% 到 83% 之間有所差距,被引用的來源以行政機關、學會等一次資訊為主(FAQ 頁面在 120 則回應中為 8 件)。FAQ 並非「被複製而曝光」的手段,而應更準確地定位為整理資訊的格式。
「只要在網站上寫好 FAQ,AI 就會原封不動地引用它來回答」——這是在 AI 搜尋最佳化的解說中經常見到的主張。是否真的如此,我們進行了實測。這是通說驗證系列的第 1 回。
設計如下。我們準備了關於就診於醫療機構的一般性問題 30 題,例如如何選擇固定就診的醫師、高額療養費制度、判斷是否需急診就診等,並向 3 個 AI 服務(OpenAI、Anthropic、Google)分別以啟用 Web 搜尋與停用的條件投入。合計 150 則回應。我們將 AI 的回答文句與 AI 所引用頁面的正文進行機械式比對,並以「逐字一致/接近的改寫/僅利用結構/未參照 FAQ」四個等級進行判定(2026 年 7 月 13 日實測)。
最初的發現,是通說的前提已然崩解。即使設定為「啟用 Web 搜尋」,AI 實際上是否進行搜尋,仍委由 AI 一方判斷。在實測中,Anthropic 的模型(輕量版)在 30 題全部都未啟動搜尋。OpenAI 在 30 題中的 12 題、Google 在 25 題中進行搜尋並回傳引用。即使以相同的「啟用搜尋」設定投入相同的問題,某個 AI 會查看今日的網路來回答,另一個 AI 則僅以學習時的知識來回答——在「FAQ 是否被引用」之前,搜尋本身不發生的情況就已相當多。
其次,是發生引用的回應之比對結果。在能夠進行逐字比對的 120 則回應中,與 FAQ 文句的逐字一致為零,接近的改寫亦為零。被判定為僅參考結構的有 5 則回應,其餘 115 則回應並未參照 FAQ。FAQ 格式的頁面被納入引用來源這件事本身,也僅止於 120 則回應中的 8 件。引用來源的核心,是厚生勞動省等行政頁面、學會,以及醫療機構的一次資訊頁面。
換言之,「只要撰寫 FAQ 就會被原封不動地複製而曝光」這樣的機制,在本次實測中並未被觀測到。即使有引用來源,AI 也會整合多個資訊來源,並改寫為自己的語言來回答。這並不是說撰寫 FAQ 沒有意義。具有與問題相對應之結構的頁面易於讀取,這一點作為另一個觀點仍然存在。只是,「被原封不動引用」這一效果的說明,與實測並不一致。
我們明確載明限制。本驗證是以 30 題、1 個時點、特定模型所進行的實測,結果可能因問題領域或模型的更新而有所改變。此外,Google 的引用是經由重新導向 URL 提供,而該中繼伺服器限制自動存取,因此逐字比對僅限於 OpenAI、Anthropic 的 120 則回應(Google 部分僅統計引用來源的種類,並區分為比對未驗證)。
本文常見問題
- Q. 這是否表示製作 FAQ 頁面沒有意義?
- A. 雖然未觀測到「被原封不動引用」的效果,但問題與回答相互對應的結構,是一種對人與 AI 都易於讀取的格式。我們認為,在準確說明其效果之後,將其定位為整理資訊的手段,是妥當的做法。
- Q. 為什麼使用哪一個 AI 會使結果不同?
- A. 這是因為判斷是否啟動 Web 搜尋的基準,以及參照資訊來源的選擇方式,各服務皆有所不同。在本次實測中,搜尋的啟動率也從 0% 到 83% 之間有所差距。
- Q. 這項驗證可以重現嗎?
- A. 我們已保存問題組與判定基準,因此可在相同條件下重新實測。變更時點的再驗證,也是本站的驗證主題。