- 定義
- 回答揺らぎ
即使向 AI 投出同一段提問文字,每次生成時表達方式、候選排序、引用來源也會有微妙不同的現象。主要因素是大型語言模型機率性的生成過程,以及伴隨 Web 搜尋的模式中即時取得結果的變動。在 LLMO 的觀察中,處理的是「將浮動納入考量後的傾向」。
- 定義
- Web検索有無
AI 在生成回答時,是即時參照外部的 Web 搜尋結果,還是僅基於內部的訓練資料,兩者之間的差異。開啟 Web 搜尋時,引用來源 URL 可觀察且最新資訊較易被反映;未開啟 Web 搜尋時,則以訓練截止時點為止的知識為主。由於兩者呈現不同種類的行為,在觀察時有必要加以區分處理。
- 定義
- 会話フロー
患者並非對 AI 只提一個問題,而是一邊反覆諮詢一邊縮小候選的一連串對話。可假設會有像「煩惱 → 治療・施術 → 地區 → 醫師的實績 → 評論 → 價格帶 → 就診便利性」這樣多輪的諮詢。LLMO 的觀察對象,不僅包含單次查詢,也包含在這個對話流程之中被處理的方式。
- 定義
- 会話内残存率
某醫療機構或醫師在對話流程初期被列為候選後,隨著諮詢推進而持續留存為候選的比率。本媒體將其用作一項指標,觀察的不僅是單次的列入候選,也包含在患者縮小條件的過程中「最終候選中留下多少」。
1. AI 搜尋結果並非固定的搜尋排名
若把「AI 搜尋對策」視為傳統 SEO 的延伸,最先浮現腦海的便是「提升排名」「讓其顯示於上位」這樣的想法。然而,AI 搜尋的回答中,排名本身的意涵已經產生了質變。
AI 搜尋的回答,必須不是當作排名這種固定值,而是當作在多個條件下觀察到的 回答傾向 來處理。Google 搜尋的結果頁(至少在短期內)會回傳相對穩定的排名。相對地,AI 搜尋的回答則是 即使是同樣的問題,每次生成時表達方式與候選排序也會改變,這才是常態。
此處所說的「條件」,例如有以下這些。
- 使用了哪個 AI 服務(ChatGPT / Claude / Gemini / Perplexity / Google AI Overviews / Microsoft Copilot 等)
- 該服務內的哪個模型(GPT 系 / Claude / Gemini / Sonar 等,可選擇的與預設的)
- 是否啟用了 Web 搜尋
- 提問文字的表達
- 在此之前的對話歷程
- 投出的時段,以及該時點 Web 上存在的資訊
即使這些全部相同,最後仍會殘留機率性生成的變異。
2. 依模型不同,回答會改變
各 AI 服務在內部會分別運用多個模型。在回答風格、引用來源的選取方式、候選集合的建構方式上,各模型之間存在可觀察的差異。
- ChatGPT — 行為會依模型選擇與有無使用 Web 搜尋而改變。在指名性高的專有名詞的處理方式上有其特徵。
- Perplexity — 以伴隨引用來源 URL 的回答為前提,傾向於相對嚴格地處理外部的資訊來源。
- Google AI Overviews — 由於回傳以 Google 搜尋索引為底的摘要,SEO 資產的累積較易被反映到回答中。在 YMYL 領域,也會觀察到出現本身受到抑制的場面。
- Microsoft Copilot — 以 Bing 搜尋為基礎,在業務場景中被參照的情況較多。
在醫療機構 LLMO 的觀察中,較為務實的做法不是只用一個服務來判斷,而是比較多個模型的回答傾向。
3. 有無 Web 搜尋,依據資訊會改變
各 AI 服務在某些情況下,可以切換即時搜尋 Web 來組建回答的模式,以及僅從訓練資料生成回答的模式。兩者呈現不同種類的行為。
- 有 Web 搜尋 — 依查詢取得 Web 上的頁面,並將其作為依據一邊引用一邊構成回答。引用來源 URL 常被明示,最新的評論・SNS 貼文・官方網站更新較易被反映。
- 無 Web 搜尋 — 基於訓練截止時點為止的知識生成回答。最新的營運資訊・活動・評論較不易被反映,但當品牌或醫師個人的認知被織入訓練資料時,有時會觀察到穩定的提及。
在醫療機構 LLMO 的觀察中,將兩種模式分別記錄很重要。因為即使判斷「有開 Web 搜尋就出現了,所以放心」,在別的使用者的設定下可能是沒開 Web 搜尋,而提示了不同的候選。
4. 即使在相同條件下,回答仍有浮動
即使把服務・模型・有無 Web 搜尋・提問文字・對話歷程全部固定,當你對同一個 AI 重新投出同樣的問題時,表達方式、候選的順序,有時甚至候選本身都可能改變。這就是本媒體所說的 回答浮動。
這並非 AI 的錯誤,而是源於大型語言模型的生成過程本質上是機率性的。在伴隨 Web 搜尋的模式中,搜尋結果的取得時機與排名側的細微變化,也會對浮動有所貢獻。
在實務上的含意很單純。
- 若以 n=1 的觀察下結論,被雜訊牽著走的可能性很高
- 需要將數次試行中觀察到的傾向,在納入浮動考量後加以解讀
- 每次試行都務必記錄「日期時間・模型・有無 Web 搜尋・提問文字・對話歷程」
5. 單次的「貴診所出現/未出現」調查為何危險
在踏實了上述之後,「現在 AI 說出了貴診所的名字並作了回答」「現在搜尋了但貴診所沒出現」這類單次調查,存在幾個陷阱。
- 偽陽性的風險 — 只不過剛好出現了一次,就判斷「LLMO 已經成功」
- 偽陰性的風險 — 只不過剛好落選了一次,就判斷「貴診所完全不會被顯示」
- 條件不一致 — 忽略了觀察者所用的模型、Web 搜尋設定、對話歷程,可能與實際患者的使用狀況不同
- 提問文字的偏差 — 觀察者越是製作意識到自家診所的提問文字,就越會成為自家診所容易出現的問題
- 缺乏比較對象 — 若只看貴診所是否出現,就無法掌握在相同條件下是否也有別的診所一起出現(競合同席率)
單次調查作為出發點是有效的,但僅憑它來判斷風險會很高。
6. 在醫療機構,於患者諮詢流程中的驗證很重要
患者使用 AI 時,並不會只以單次的關鍵字搜尋作結。實際觀察到的諮詢,會經過例如以下的對話流程。
- 「我很在意眼周的鬆弛。有哪些治療會成為候選?」
- 「我想先從恢復期短的來考慮。」
- 「在〇〇地區可通勤的範圍內,哪些地方會成為候選?」
- 「若重視自然的成果,哪位醫師會成為候選?」
- 「價格帶大約多少?併發症應對是怎麼安排的?」
- 「若最終要縮小到 2〜3 間,會是哪些?」
在這個流程的每個階段,AI 把誰列入候選、在哪些條件下將其排除,才是醫療機構這一方真正的論點。會觀察到諸如第 1 題出現但第 5 題落選、或第 1 題落選但從第 3 題起進入候選這樣的模式。本媒體將這種「在對話中持續留存為候選的比率」稱為 會話內殘存率。
單次調查無法掌握這個會話內殘存率。將觀察以對話流程為單位來設計,是醫療機構 LLMO 的實務驗證中不可或缺的視角。
7. 在美容診所,醫師個人・施術・評論・症例會被比較
以美容診所・自費診療診所而言,AI 在對話流程中試圖參照的資訊,不僅是機構名稱,還橫跨以下這類的資訊來源。
- 醫師個人 — 經歷・專門領域・症例傾向・應對風格・在 SNS 上的發言
- 各施術的專業性 — 施術類別 × 經驗年數 × 症例數的組合
- 評論 — Google Business Profile、評論專門網站、SNS 上的提及
- 症例表現 — 踏實醫療廣告指南的限定解除要件後的症例說明
- 併發症應對 — 併發症發生時的應對體制・合作醫療機構・後續追蹤
- 價格帶 — 所提示的收費體系與其透明度
- 外部的參照資訊 — 學會官方、醫師等資格確認、媒體刊載等的相互參照
AI 重點參照的資訊來源,會依對話的階段而改變。例如在被問到「自然的成果」的場面,症例與評論會被大量參照。在被問到「併發症應對」的場面,官方網站的後續追蹤記述與外部的醫師資格確認則較易浮上前面。會觀察到這樣的傾向。
8. 醫療機構 AI 搜尋實驗室要驗證的事
本媒體以醫療機構為對象,從以下觀點持續觀察 AI 搜尋。
- 多個 AI 服務與模型的回答傾向(模型差)
- 有 Web 搜尋與無 Web 搜尋在依據資訊・候選集合上的差異
- 相同條件下回答浮動的幅度
- 接近患者諮詢的對話流程中的會話內殘存率
- 各局面中 AI 看似正在參照的材料(醫師・施術・評論・症例・併發症應對・價格帶・外部的參照資訊)
這些是為了超越單次的「出現/未出現」,將其當作傾向來解讀。觀察對象增加得越多,浮動就越會被平均化。其結果是,貴診所或負責醫師「在哪個條件下列入候選、在哪個條件下落選」會變得更容易看見。
本媒體及諮詢選單,並非以固定結果或控制顯示為目的。它處理的是為了整理資訊使 AI 能正確理解、並在浮動之中增加比較時被參照的材料,所進行的觀察與改善論點的整理。
出處/參考資料
- Google Search Central — AI features in Search — Google / 2025關於包含 AI Overviews 在內的 AI 功能之行為與動態性的官方說明
- ChatGPT search — Help Center — OpenAI / 2025ChatGPT Search 中 Web 搜尋的啟用與參照來源的處理
- Perplexity — About / How it works — Perplexity / 2025關於引用來源的處理與回答生成流程的官方說明
- Google Search Quality Evaluator Guidelines — Google / 2025搜尋品質評估指南與 E-E-A-T 的框架
- 医療法における病院等の広告規制について(医療広告ガイドライン) — 厚生労働省 / 2024-09美容醫療・自費診療領域中表現的前提
本文常見問題
- Q. 為什麼向同一個 AI 問同樣的問題,回答還是會變?
- A. 大型語言模型的回答生成含有機率性的要素,即使輸入相同,每次生成時的表達方式與候選排序也會有微妙變化。在伴隨 Web 搜尋的模式中,還會加上即時取得的資訊來源的變動,因此即使在相同條件下,也會觀察到回答的浮動。
- Q. 有開 Web 搜尋與沒開,差別在哪裡?
- A. 開啟 Web 搜尋時,AI 會取得最新的 Web 資訊並以此作為回答的依據,因此被參照的 URL 與引用來源可能每次觀察都不同。未開啟 Web 搜尋時,回答是基於訓練截止時點為止的知識,因此最新的評論或活動資訊較不易被反映,會呈現另一種傾向。
- Q. 貴診所在 AI 上出現一次,就算 LLMO 成功了嗎?
- A. 單次的出現是重要的觀測點,但不能說是 LLMO 足夠的評估軸。較為務實的做法是,變換同樣的提問、不同的提問、模型、有無 Web 搜尋、對話脈絡等,觀察多次,並確認在哪些條件下貴診所會列入候選、在哪些條件下會落選的傾向。
- Q. 為什麼醫療機構需要以對話流程來驗證?
- A. 患者並非以單次的關鍵字搜尋作結,而是像「煩惱 → 治療・施術 → 地區 → 醫師的實績 → 評論 → 價格帶」這樣一邊反覆諮詢一邊縮小候選。重要的是觀察在對話脈絡之中貴診所是否持續留在候選(會話內殘存率),這是僅憑一問一答看不出來的。
- Q. AI 搜尋結果的浮動可以改善嗎?
- A. 無法完全固定結果,也無法控制顯示。另一方面,透過推進讓 AI 能正確理解的資訊整理方式(醫師資訊、症例、評論、FAQ、併發症應對、外部的參照資訊、結構化資料的一致性),可以增加比較時被參照的資訊,讓貴診所即使在浮動之中也更容易被列為候選,是有可能的。
相關文章
- AI 搜尋
AI 是如何介紹你的診所的
- LLMO
只靠內容品質就能被 AI 介紹嗎
- AI 搜尋
醫療機構應關注的 AI 搜尋差異