医療機関AI検索ラボMEDICAL AI SEARCH LAB

為什麼不該只問 AI 一次,就決定貴診所的 AI 搜尋對策

只要向 AI 提問一次,就能大致了解貴診所被呈現的樣貌與可改善之處。然而 AI 的回答會依提問文字、模型、對話流程與時期而改變。僅憑一次回答就判斷對策是危險的。本文整理持續觀察醫療機構在 AI 搜尋中如何被處理的前提。

AI 搜尋
定義
回答揺らぎ

即使向 AI 投出同一段提問文字,每次生成時表達方式、候選排序、引用來源也會有微妙不同的現象。主要因素是大型語言模型機率性的生成過程,以及伴隨 Web 搜尋的模式中即時取得結果的變動。在 LLMO 的觀察中,處理的是「將浮動納入考量後的傾向」。

定義
Web検索有無

AI 在生成回答時,是即時參照外部的 Web 搜尋結果,還是僅基於內部的訓練資料,兩者之間的差異。開啟 Web 搜尋時,引用來源 URL 可觀察且最新資訊較易被反映;未開啟 Web 搜尋時,則以訓練截止時點為止的知識為主。由於兩者呈現不同種類的行為,在觀察時有必要加以區分處理。

定義
会話フロー

患者並非對 AI 只提一個問題,而是一邊反覆諮詢一邊縮小候選的一連串對話。可假設會有像「煩惱 → 治療・施術 → 地區 → 醫師的實績 → 評論 → 價格帶 → 就診便利性」這樣多輪的諮詢。LLMO 的觀察對象,不僅包含單次查詢,也包含在這個對話流程之中被處理的方式。

定義
会話内残存率

某醫療機構或醫師在對話流程初期被列為候選後,隨著諮詢推進而持續留存為候選的比率。本媒體將其用作一項指標,觀察的不僅是單次的列入候選,也包含在患者縮小條件的過程中「最終候選中留下多少」。

1. AI 搜尋結果並非固定的搜尋排名

若把「AI 搜尋對策」視為傳統 SEO 的延伸,最先浮現腦海的便是「提升排名」「讓其顯示於上位」這樣的想法。然而,AI 搜尋的回答中,排名本身的意涵已經產生了質變。

AI 搜尋的回答,必須不是當作排名這種固定值,而是當作在多個條件下觀察到的 回答傾向 來處理。Google 搜尋的結果頁(至少在短期內)會回傳相對穩定的排名。相對地,AI 搜尋的回答則是 即使是同樣的問題,每次生成時表達方式與候選排序也會改變,這才是常態。

此處所說的「條件」,例如有以下這些。

  • 使用了哪個 AI 服務(ChatGPT / Claude / Gemini / Perplexity / Google AI Overviews / Microsoft Copilot 等)
  • 該服務內的哪個模型(GPT 系 / Claude / Gemini / Sonar 等,可選擇的與預設的)
  • 是否啟用了 Web 搜尋
  • 提問文字的表達
  • 在此之前的對話歷程
  • 投出的時段,以及該時點 Web 上存在的資訊

即使這些全部相同,最後仍會殘留機率性生成的變異。

2. 依模型不同,回答會改變

各 AI 服務在內部會分別運用多個模型。在回答風格、引用來源的選取方式、候選集合的建構方式上,各模型之間存在可觀察的差異。

  • ChatGPT — 行為會依模型選擇與有無使用 Web 搜尋而改變。在指名性高的專有名詞的處理方式上有其特徵。
  • Perplexity — 以伴隨引用來源 URL 的回答為前提,傾向於相對嚴格地處理外部的資訊來源。
  • Google AI Overviews — 由於回傳以 Google 搜尋索引為底的摘要,SEO 資產的累積較易被反映到回答中。在 YMYL 領域,也會觀察到出現本身受到抑制的場面。
  • Microsoft Copilot — 以 Bing 搜尋為基礎,在業務場景中被參照的情況較多。

在醫療機構 LLMO 的觀察中,較為務實的做法不是只用一個服務來判斷,而是比較多個模型的回答傾向。

3. 有無 Web 搜尋,依據資訊會改變

各 AI 服務在某些情況下,可以切換即時搜尋 Web 來組建回答的模式,以及僅從訓練資料生成回答的模式。兩者呈現不同種類的行為。

  • 有 Web 搜尋 — 依查詢取得 Web 上的頁面,並將其作為依據一邊引用一邊構成回答。引用來源 URL 常被明示,最新的評論・SNS 貼文・官方網站更新較易被反映。
  • 無 Web 搜尋 — 基於訓練截止時點為止的知識生成回答。最新的營運資訊・活動・評論較不易被反映,但當品牌或醫師個人的認知被織入訓練資料時,有時會觀察到穩定的提及。

在醫療機構 LLMO 的觀察中,將兩種模式分別記錄很重要。因為即使判斷「有開 Web 搜尋就出現了,所以放心」,在別的使用者的設定下可能是沒開 Web 搜尋,而提示了不同的候選。

4. 即使在相同條件下,回答仍有浮動

即使把服務・模型・有無 Web 搜尋・提問文字・對話歷程全部固定,當你對同一個 AI 重新投出同樣的問題時,表達方式、候選的順序,有時甚至候選本身都可能改變。這就是本媒體所說的 回答浮動

這並非 AI 的錯誤,而是源於大型語言模型的生成過程本質上是機率性的。在伴隨 Web 搜尋的模式中,搜尋結果的取得時機與排名側的細微變化,也會對浮動有所貢獻。

在實務上的含意很單純。

  • 若以 n=1 的觀察下結論,被雜訊牽著走的可能性很高
  • 需要將數次試行中觀察到的傾向,在納入浮動考量後加以解讀
  • 每次試行都務必記錄「日期時間・模型・有無 Web 搜尋・提問文字・對話歷程」

5. 單次的「貴診所出現/未出現」調查為何危險

在踏實了上述之後,「現在 AI 說出了貴診所的名字並作了回答」「現在搜尋了但貴診所沒出現」這類單次調查,存在幾個陷阱。

  • 偽陽性的風險 — 只不過剛好出現了一次,就判斷「LLMO 已經成功」
  • 偽陰性的風險 — 只不過剛好落選了一次,就判斷「貴診所完全不會被顯示」
  • 條件不一致 — 忽略了觀察者所用的模型、Web 搜尋設定、對話歷程,可能與實際患者的使用狀況不同
  • 提問文字的偏差 — 觀察者越是製作意識到自家診所的提問文字,就越會成為自家診所容易出現的問題
  • 缺乏比較對象 — 若只看貴診所是否出現,就無法掌握在相同條件下是否也有別的診所一起出現(競合同席率)

單次調查作為出發點是有效的,但僅憑它來判斷風險會很高。

6. 在醫療機構,於患者諮詢流程中的驗證很重要

患者使用 AI 時,並不會只以單次的關鍵字搜尋作結。實際觀察到的諮詢,會經過例如以下的對話流程。

  1. 「我很在意眼周的鬆弛。有哪些治療會成為候選?」
  2. 「我想先從恢復期短的來考慮。」
  3. 「在〇〇地區可通勤的範圍內,哪些地方會成為候選?」
  4. 「若重視自然的成果,哪位醫師會成為候選?」
  5. 「價格帶大約多少?併發症應對是怎麼安排的?」
  6. 「若最終要縮小到 2〜3 間,會是哪些?」

在這個流程的每個階段,AI 把誰列入候選、在哪些條件下將其排除,才是醫療機構這一方真正的論點。會觀察到諸如第 1 題出現但第 5 題落選、或第 1 題落選但從第 3 題起進入候選這樣的模式。本媒體將這種「在對話中持續留存為候選的比率」稱為 會話內殘存率

單次調查無法掌握這個會話內殘存率。將觀察以對話流程為單位來設計,是醫療機構 LLMO 的實務驗證中不可或缺的視角。

7. 在美容診所,醫師個人・施術・評論・症例會被比較

以美容診所・自費診療診所而言,AI 在對話流程中試圖參照的資訊,不僅是機構名稱,還橫跨以下這類的資訊來源。

  • 醫師個人 — 經歷・專門領域・症例傾向・應對風格・在 SNS 上的發言
  • 各施術的專業性 — 施術類別 × 經驗年數 × 症例數的組合
  • 評論 — Google Business Profile、評論專門網站、SNS 上的提及
  • 症例表現 — 踏實醫療廣告指南的限定解除要件後的症例說明
  • 併發症應對 — 併發症發生時的應對體制・合作醫療機構・後續追蹤
  • 價格帶 — 所提示的收費體系與其透明度
  • 外部的參照資訊 — 學會官方、醫師等資格確認、媒體刊載等的相互參照

AI 重點參照的資訊來源,會依對話的階段而改變。例如在被問到「自然的成果」的場面,症例與評論會被大量參照。在被問到「併發症應對」的場面,官方網站的後續追蹤記述與外部的醫師資格確認則較易浮上前面。會觀察到這樣的傾向。

8. 醫療機構 AI 搜尋實驗室要驗證的事

本媒體以醫療機構為對象,從以下觀點持續觀察 AI 搜尋。

  • 多個 AI 服務與模型的回答傾向(模型差)
  • 有 Web 搜尋與無 Web 搜尋在依據資訊・候選集合上的差異
  • 相同條件下回答浮動的幅度
  • 接近患者諮詢的對話流程中的會話內殘存率
  • 各局面中 AI 看似正在參照的材料(醫師・施術・評論・症例・併發症應對・價格帶・外部的參照資訊)

這些是為了超越單次的「出現/未出現」,將其當作傾向來解讀。觀察對象增加得越多,浮動就越會被平均化。其結果是,貴診所或負責醫師「在哪個條件下列入候選、在哪個條件下落選」會變得更容易看見。

本媒體及諮詢選單,並非以固定結果或控制顯示為目的。它處理的是為了整理資訊使 AI 能正確理解、並在浮動之中增加比較時被參照的材料,所進行的觀察與改善論點的整理。

出處/參考資料

  1. Google Search Central — AI features in SearchGoogle / 2025關於包含 AI Overviews 在內的 AI 功能之行為與動態性的官方說明
  2. ChatGPT search — Help CenterOpenAI / 2025ChatGPT Search 中 Web 搜尋的啟用與參照來源的處理
  3. Perplexity — About / How it worksPerplexity / 2025關於引用來源的處理與回答生成流程的官方說明
  4. Google Search Quality Evaluator GuidelinesGoogle / 2025搜尋品質評估指南與 E-E-A-T 的框架
  5. 医療法における病院等の広告規制について(医療広告ガイドライン)厚生労働省 / 2024-09美容醫療・自費診療領域中表現的前提

本文常見問題

Q. 為什麼向同一個 AI 問同樣的問題,回答還是會變?
A. 大型語言模型的回答生成含有機率性的要素,即使輸入相同,每次生成時的表達方式與候選排序也會有微妙變化。在伴隨 Web 搜尋的模式中,還會加上即時取得的資訊來源的變動,因此即使在相同條件下,也會觀察到回答的浮動。
Q. 有開 Web 搜尋與沒開,差別在哪裡?
A. 開啟 Web 搜尋時,AI 會取得最新的 Web 資訊並以此作為回答的依據,因此被參照的 URL 與引用來源可能每次觀察都不同。未開啟 Web 搜尋時,回答是基於訓練截止時點為止的知識,因此最新的評論或活動資訊較不易被反映,會呈現另一種傾向。
Q. 貴診所在 AI 上出現一次,就算 LLMO 成功了嗎?
A. 單次的出現是重要的觀測點,但不能說是 LLMO 足夠的評估軸。較為務實的做法是,變換同樣的提問、不同的提問、模型、有無 Web 搜尋、對話脈絡等,觀察多次,並確認在哪些條件下貴診所會列入候選、在哪些條件下會落選的傾向。
Q. 為什麼醫療機構需要以對話流程來驗證?
A. 患者並非以單次的關鍵字搜尋作結,而是像「煩惱 → 治療・施術 → 地區 → 醫師的實績 → 評論 → 價格帶」這樣一邊反覆諮詢一邊縮小候選。重要的是觀察在對話脈絡之中貴診所是否持續留在候選(會話內殘存率),這是僅憑一問一答看不出來的。
Q. AI 搜尋結果的浮動可以改善嗎?
A. 無法完全固定結果,也無法控制顯示。另一方面,透過推進讓 AI 能正確理解的資訊整理方式(醫師資訊、症例、評論、FAQ、併發症應對、外部的參照資訊、結構化資料的一致性),可以增加比較時被參照的資訊,讓貴診所即使在浮動之中也更容易被列為候選,是有可能的。