本文重點
- 大阪 400 家美容相關診所機器可讀性的實際狀況
- 與解說端 67 個網站的比較
- 檢視貴診所網站的兩個起點
結論
AI 爬蟲全部允許為 89%、llms.txt 設置為 10%、結構化資料為 52%。絕大多數醫療機構處於「並未拒絕 AI,但也未積極準備」的狀態。機器可讀形式的整備並不困難,一旦整備完成,在前提條件上便能進入領先集團。
本文使用的詞彙
- robots.txt
- 放在網站入口、給爬蟲(自動前來讀取網站的程式)看的說明文。是一個記載哪個程式可讀取哪些部分、哪些不可讀取的文字檔。
- AI 爬蟲
- ChatGPT、Gemini 等 AI 服務前來讀取網站時所使用的程式。GPTBot、ClaudeBot、PerplexityBot 等,各服務都有各自固定的名稱。
- llms.txt
- 面向 AI、摘要說明「本網站有什麼」而放置的引導檔。是相對較新的提案,設置與否為任意。
- sitemap.xml
- 將網站內的頁面清單整理成機器可讀形式的檔案。可讓搜尋引擎與 AI 更容易找到頁面。
- 結構化資料(JSON-LD)
- 將頁面內容以機器可理解的形式附加標註者。把「這是診療時間」「這是醫師姓名」等意義,與面向人類的顯示分開持有。
- 機器可讀性調查
- 並非網站內容的品質,而是從外部以機器方式調查上述「從機器看到的形式」是否齊備。
被視為 AI 搜尋候選的前提條件,是網站處於 AI 可讀取的狀態。那麼,醫療機構端的實際狀況如何呢?繼前次調查解說端 67 個網站之後,本次針對醫療機構端——大阪府的美容相關診所 400 家進行了機器可讀性調查。
以下為設計。以源自厚生勞動省醫療資訊網(i-Iryojoho)的大阪府醫科診療所中,標榜美容外科、美容皮膚科、整形外科、皮膚科任一者的 1,171 家機構為母體,從可確認網站 URL 的機構中,以機械化的規則抽取出 400 家機構(未做任意的挑選)。針對各機構的網站,機械化判定了以下機器可讀項目:robots.txt 中主要 12 種 AI 爬蟲的允許狀況、llms.txt 的設置、sitemap.xml、結構化資料(JSON-LD)、meta 描述、https(測量日:2026 年 7 月 13 日)。
以下為結果。允許全部 12 種主要 AI 爬蟲的為 400 家機構中的 356 家(89%)。另一方面,將 GPTBot、ClaudeBot 等一併封鎖的機構有 8 家。設置 llms.txt 的為 39 家機構(10%)。有輸出結構化資料(JSON-LD)的為 209 家機構(52%)。sitemap.xml 為 321 家機構(80%)。無法判定率為 8.9%(以 JavaScript 描繪的網站或平台型網站,基於初始 HTML 的判定會與實態產生偏差,故區分為無法判定)。
與前次調查的 LLMO、GEO 解說網站 67 件的分布(AI 爬蟲全部允許 93%、llms.txt 27%、結構化資料 70%)並列後,構圖便浮現出來。AI 爬蟲的允許率在解說端與醫療機構端幾乎沒有差異(93% 對 89%)。這可視為許多網站在 robots.txt 中並未個別提及 AI 爬蟲——維持初始狀態——的反映。拉開差距的是主動設置的項目,llms.txt 為 27% 對 10%、結構化資料為 70% 對 52%。此外,醫療機構端的結構化資料中,應包含預約系統或 CMS 預設輸出的部分,因此有意識整備的比率可能低於此數字。
該如何解讀此結果。絕大多數醫療機構處於「並未拒絕 AI,但也未積極準備」的狀態。一併封鎖的 8 件,是各機構不希望用於訓練等的正當選擇。重要的是,機器可讀形式的整備本身絕非困難這一點。確認 robots.txt、輸出結構化資料、必要時設置 llms.txt——僅整備這些,至少在「可讀狀態」這項前提條件上,便能進入現狀分布的領先集團。不過,正如本站的定點觀測所示,可讀狀態只不過是被推薦條件的入口。在整備好可讀性之上,觀測貴診所在 AI 上如何被對待——此順序才是務實的。
明確記載限制。本調查為機器可讀形式的機械判定,並非測量內容品質或在 AI 搜尋中實際被對待的方式,其有無亦不代表機構的優劣。對象為大阪府某一時點的觀測(全國調查目前正在進行中,完成後將另行報告)。(2026-07-14 補充:已公開全國調查)
本文常見問題
- Q. 可以確認本院是否被納入調查對象嗎?
- A. 本調查僅公開匿名的分布,並未公布個別機構的判定結果。貴診所的狀態,任何人都可以透過確認 robots.txt 與結構化資料的輸出,以相同的觀點進行檢視。
- Q. 若封鎖 AI 爬蟲會怎麼樣?
- A. 會使發動搜尋類型的 AI 較難參照網站的內容。封鎖在希望避免用於訓練等情況下是正當的選擇,但由於難以與經由 AI 搜尋的曝光並存,因此以方針的形式有意識地選擇很重要。
- Q. 應該先從什麼開始整備?
- A. 在機器可讀性層面,起點有兩個:確認 robots.txt 是否無意間封鎖了主要 AI 爬蟲,以及結構化資料的輸出。在此之上,講述施術與診療內容的實質頁面是否完備,是比機器可讀形式更為本質的課題。