医療機関AI検索ラボMEDICAL AI SEARCH LAB

解說 LLMO 的網站本身,是否處於 AI 可讀的狀態?——67 個網站的機器可讀性調查

我們對解說 AI 搜尋最佳化的 67 個國內網站進行了機器可讀性調查。全面允許 AI 爬蟲者佔 93%、設置 llms.txt 者佔 27%。解說一方「準備狀況」的實態,以及與醫療機構一方的比較。

LLMO

本文重點

  1. 解說 LLMO 一方 67 個網站的機器可讀性實態
  2. 與醫療機構一方比較所呈現的結構
  3. 在貴診所網站上最先應確認的兩點

結論

解說一方 67 個網站中,全面允許 AI 爬蟲者佔 93%,設置 llms.txt 者僅止於 27%。可讀性的基礎,與被 AI 推薦,是兩個不同的問題;可讀性不過是前提條件而已。

本文使用的詞彙
robots.txt
放在網站入口、給爬蟲(自動前來讀取網站的程式)看的說明文。是一個記載哪個程式可讀取哪些部分、哪些不可讀取的文字檔。
AI 爬蟲
ChatGPT、Gemini 等 AI 服務前來讀取網站時所使用的程式。GPTBot、ClaudeBot、PerplexityBot 等,各服務都有各自固定的名稱。
llms.txt
面向 AI、摘要說明「本網站有什麼」而放置的引導檔。是相對較新的提案,設置與否為任意。
sitemap.xml
將網站內的頁面清單整理成機器可讀形式的檔案。可讓搜尋引擎與 AI 更容易找到頁面。
結構化資料(JSON-LD)
將頁面內容以機器可理解的形式附加標註者。把「這是診療時間」「這是醫師姓名」等意義,與面向人類的顯示分開持有。
機器可讀性調查
並非網站內容的品質,而是從外部以機器方式調查上述「從機器看到的形式」是否齊備。

針對 AI 搜尋的最佳化——被稱為 LLMO 或 GEO 的領域——加以解說的資訊網站,在這一年間急速增加。那麼,解說它的網站本身,是否處於 AI 可讀的狀態呢?

我們使用本站的機器可讀性調查流程,進行了實測。

調查的設計如下。我們以機械方式收集了在「LLMO 對策是什麼」「GEO 生成引擎最佳化 對策」等 8 個關於 AI 搜尋最佳化的既定搜尋查詢中名列前段的國內網站,整合重複後,以 67 個網域為對象。並未進行恣意的挑選。針對各網站,我們就 robots.txt 中主要 AI 爬蟲 12 種(GPTBot、ClaudeBot、PerplexityBot、Google-Extended 等)的允許狀況、llms.txt 的設置、sitemap.xml、結構化資料(JSON-LD)、meta 描述、https 等機器可讀性項目進行了機械判定(測定日:2026 年 7 月 13 日)。

以下是結果。67 個網站中,全面允許主要 AI 爬蟲 12 種的有 62 個網站(93%)。另一方面,設置 llms.txt 的僅止於 18 個網站(27%)。輸出結構化資料(JSON-LD)的有 47 個網站(70%)。此外雖為少數,但在 robots.txt 中封鎖部分或全部主要 AI 爬蟲的網站有 3 件,在提供資訊的一方也存在。

為了比較,我們把以相同流程調查的大阪府美容相關診所 400 家的分布並列出來。全面允許 AI 爬蟲為 89%、llms.txt 設置為 10%、JSON-LD 為 52%。

從這個對比中可以讀出兩點。

第一,AI 爬蟲的允許狀況,在解說一方(93%)與醫療機構一方(89%)之間幾乎沒有差異。這可以認為反映出許多網站在 robots.txt 中並未個別提及 AI 爬蟲——也就是說並非有意的允許,而是維持初始狀態原封不動。差異出現在 llms.txt(27% 對 10%)或結構化資料(70% 對 52%)這類需要主動設置的項目上。可以說,解說的一方在某種程度上實踐了自己所推薦的施策。不過若僅就 llms.txt 而言,即使是提倡、解說的一方,也有超過七成尚未設置,這就是現狀。

第二,機器可讀的基礎,與被 AI 推薦,是兩個不同的問題。在本站的另一項觀察(定點觀測第 1 回)中,被列入 AI 推薦清單的網站當中,包含了限制自動存取的網站;另一方面,整備好基礎的新網站卻並未被列入。可讀性是前提條件,而非決定推薦的因素。這種不對稱,與本次的分布並不矛盾。

最後,明確記述本次調查的限制。機器可讀性調查是對「是否處於可讀狀態」的判定,並非測定內容的品質或在 AI 搜尋中實際被對待的方式。有無也並不代表網站的優劣。此外,對於以 JavaScript 描繪的網站或平台型網站,基於初始 HTML 的判定可能與實態有所偏差(我們將其區分為無法判定)。

對醫療機構的含意很簡單。llms.txt 與結構化資料的設置率,即使是解說的一方也是這個水準。醫療機構要整備這些本身並不困難,只要整備,在「處於可讀狀態」這個前提條件上就能進入領先集團。不過,那並不保證引用或推薦——其後的驗證,正是本站以實測所處理的領域。

本文常見問題

Q. 未設置 llms.txt 的網站,是否就不會被 AI 讀取呢?
A. 並非如此。llms.txt 是作為面向 AI 的網站導覽而被提倡的較新機制,即使未設置,AI 爬蟲仍能讀取頁面本身。設置只是提高可讀性的選項之一。
Q. 為什麼會有網站封鎖 AI 爬蟲呢?
A. 這可能是出於各網站自身的方針,例如不希望內容被用於訓練、或想避免伺服器負載等。封鎖本身是各網站正當的選擇。
Q. 醫療機構的網站首先應該確認什麼呢?
A. 貴診所網站的 robots.txt 是否封鎖了主要 AI 爬蟲、以及是否有輸出結構化資料,這兩點是機器可讀性上的起點。在此之上,觀測貴診所在 AI 上如何被對待,會成為判斷的材料。

相關資料庫(僅日文):データベース一覧