為什麼現在就要重視這件事?因為傳統的排名追蹤工具完全看不到這些。你的品牌可能已經在整個品類的 ChatGPT 推薦中完全消失,而 GA4 上卻毫無異狀——直到業務管道不知不覺枯竭。根據 McKinsey 研究,50% 的消費者現在會刻意使用 AI 搜尋引擎,其中 44% 把 AI 當作採購決策的主要資訊來源。那些在 AI 對話中跳過你的買家,正在建立一份你從未出現過的候選名單。
這篇指南會給你精確的計算公式、一套可重複執行的五步驟量測流程,以及對 DIY 量測瓶頸的坦白分析。
重點摘要
- 核心 AI SOV 公式:
(你的品牌提及次數 / 所有追蹤品牌的總提及次數)x 100。每個平台至少跑 50 組目標提示詞。 - 排序跟出現一樣重要。 加上位置加權公式(權重 = 1 / 排序位置),才能捕捉到單純計數看不出來的信任訊號。
- 各平台行為差異很大。 ChatGPT 明顯偏好維基百科和結構化的出版網站;Perplexity 則大量拉取 Reddit、YouTube 和技術文件。只量測一個平台,得到的畫面會嚴重失真。
- 「封閉池」錯誤會讓 SOV 虛高。 如果你只追蹤 3–4 個預設競品,但 AI 實際推薦了 10 個品牌,你算出來的 SOV 就是錯的。分母必須開放給 LLM 自然提到的所有品牌。
- AI 推薦流量的轉換率比一般自然搜尋高 4.4 到 6 倍(來自 Perplexity 和 ChatGPT 的數據)。衡量 AI SOV 是營收問題,不是虛榮指標。
- 有完整 schema 的頁面出現在 AI Overviews 的機率高 3 倍(AEO 稽核研究)。技術層面的可擷取性是多數品牌完全忽略的環節。
為什麼多數品牌看不到這個問題
傳統 SEO 儀表板追蹤的是 Google 裡的排名、點擊和曝光。這些訊號通通偵測不到買家打開 ChatGPT 問「Series A 金融科技公司最好的合規工具是什麼?」時發生的事。如果你的品牌沒出現在那個回覆裡,現有的分析工具不會發出任何警訊。損失是隱形的。
這跟掉 Google 排名在結構上完全不同。從第 3 名掉到第 7 名,流量會下降,你看得到。但在 AI 回覆中缺席時,買家只是建立了一份沒有你的候選清單——你的業務管道看起來一切正常,直到某天突然不正常。
複利效應讓這件事更加急迫。出現在 AI 推薦裡的競品會持續累積引用動能。AI 模型從全網的模式中學習,今天拿到引用的品牌,明天更可能繼續被引用。你每延遲一週量測,競品就在你看不到的對話中多領先一週。
計算 LLM 聲量佔比的四種公式
沒有任何單一公式能涵蓋 AI 能見度的每個面向。最嚴謹的做法至少會組合使用其中兩種。
公式一:基本提及次數 AI SOV
這是基礎。把你的品牌提及次數除以 LLM 在整組提示詞中出現的所有品牌提及總數。
AI SOV =(你的品牌提及次數 / 所有追蹤品牌的總提及次數)x 100
公式二:位置加權 AI SOV
在 AI 回覆中被列為第一名跟被列為第五名差很多。模型透過排序傳達不同程度的信心和相關性,位置加權計算可以抓住這個訊號。
權重 = 1 / 排序位置
(第 1 名 = 1.00、第 2 名 = 0.50、第 3 名 = 0.33、第 4 名 = 0.25...)
加權 AI SOV =(你的品牌總權重 / 所有品牌權重總和)x 100
公式三:字數佔比 SOV
針對高價值的個別查詢,可以量測你的品牌在合成回覆中實際佔了多少篇幅。
字數 SOV =(提及你的品牌的字數 / 回覆總字數)x 100
公式四:回覆涵蓋率(提示詞出現率)
又稱覆蓋率或提示詞能見度,計算你的品牌在整組提示詞中「到底出現了幾次」。
ASoV =(包含你品牌的提示詞數量 / 測試的總提示詞數量)x 100
如果測試 100 組提示詞,你的品牌出現在其中 23 組,回覆涵蓋率就是 23%。這個指標特別適合找出盲區:有哪些買家問題你完全沒有存在感。
五步驟量測流程
第一步:建立提示詞庫
開始量測之前,你需要一組能代表真實買家行為的查詢。關鍵字研究工具反映的是人們在 Google 打什麼字,不是他們怎麼跟 AI 說話。建立 50 到 100 組高購買意圖的對話式提示詞。
把它們分成三類:
- 品牌提示詞:「[你的品牌名] 是什麼?」測試 AI 是否對你的品牌有清楚正確的理解。
- 品類提示詞:「[特定 ICP 情境]最好的[品類]工具有哪些?」測試你在競爭對手中的聲量佔比。
- 比較提示詞:「[競品 A] vs. [競品 B],哪個比較適合[特定場景]?」測試功能關聯性和你是否出現在直接對比中。
提示詞的來源包括業務通話逐字稿、客服工單和現有的 AI 回覆版圖。最有價值的提示詞是你的買家已經在問的問題,不是你以為他們會問的。
第二步:建立受控的查詢流程
提示詞庫準備好之後,跑查詢的方式決定數據是否可靠。LLM 會根據對話脈絡和歷史紀錄產生不同回覆,所以每次測試都必須控制變因。
每組提示詞用一個全新的獨立聊天視窗。絕對不要把前一次測試的上下文帶進來。每組提示詞至少跑 3 到 5 次獨立測試,以涵蓋 LLM 輸出的隨機變異。然後在至少四個平台上重複:ChatGPT、Perplexity、Gemini、Claude。
第三步:為每個回覆記錄完整的數據矩陣
每跑一組提示詞,往下走之前先記錄五個數據點:
- 是否出現: 你的品牌有沒有被提到?(是 / 否)
- 排序位置: 你的品牌在推薦清單中排第幾?(第 1、第 2、第 5...)
- 出現的競品: 還有哪些品牌出現?排序如何?
- 引用來源: LLM 引用了哪些外部網址來組成回答?這是逆向工程理解引用驅動因素最重要的工具。
- 情感調性: 你的品牌被描述為領導者、平價替代方案,還是有被提到缺點或限制?
第四步:套用公式,建立基準線
彙整數據矩陣,針對每個平台至少跑公式一(基本提及 SOV)和公式二(位置加權 SOV)。ChatGPT、Perplexity、Gemini、Claude 要分開算,不要合成一個數字。各平台行為差異非常大。
這個基準線就是你的比較基礎。之後每次量測都拿它來對照。
第五步:把 AI SOV 接上營收體系
單看 SOV 數字看不出什麼在推動業務。要從「有用的量測」升級到「可行動的洞察」,關鍵是把 AI 能見度數據與 Google Search Console、GA4 和 AI 推薦流量串起來。
在 GA4 設定 AI 推薦來源的 UTM 追蹤。監控來自 chat.openai.com、perplexity.ai 和 gemini.google.com 的推薦流量。追蹤 AI 推薦訪客的進站頁面、停留時間和是否轉換。這層連結讓你不只知道品牌出現在哪些提示詞中,更能找出哪些提示詞真正帶來了合格的進線商機。
讓 SOV 數據出錯的三大常見錯誤
封閉池錯誤
任何 SOV 公式的分母,都必須開放給 LLM 自然提到的所有品牌,而不是只算你預期的那幾個。
忽略情感脈絡
每組提示詞的回覆都要量測情感調性,不能只看有沒有出現和排第幾。
以為技術基礎不是瓶頸
很多成長團隊一看到 AI SOV 低,馬上去趕更多部落格文章。但 AI 爬蟲讀不到的內容,不會拿到引用。GPTBot 和 PerplexityBot 看到的跟人類訪客一樣是 JavaScript 密集、圖片導向的行銷頁面。乾淨的實體定義、FAQPage schema 和為 LLM 擷取設計的結構化資料,才是讓頁面從「隱形」變成「可被引用」的關鍵。
這是我們在品牌做第一次 GEO 稽核時最常看到的缺口。把更多內容倒進一個壞掉的技術層,引用數不會有任何改善。
DIY 量測在什麼時候會撐不住
手動 SOV 追蹤很適合建立初始基準線。但要持續大規模執行,會因為三個原因而無法為繼。
多數團隊沒有那個頻寬。儀表板變成一份沒人把它轉化為行動的昂貴報告。
全代管方案是什麼樣子
從「看到 AI SOV 數據」到「改變 AI SOV」之間的執行落差,是多數計畫卡住的地方。
Mersel AI 專門為解決這個落差而設計——但值得直說這代表什麼。Mersel 是全代管的服務,不是自助式儀表板。如果你需要即時提示詞監測、自己跑查詢的彈性和直接操作介面,Profound 或 AthenaHQ 這類自助平台會更適合你。
Mersel 執行的是一套閉環系統:根據你的買家當下實際在問 AI 的對話問題,產出提示詞對應的內容,直接發佈到你的 CMS。這些文章從第一句話就為 AI 擷取而設計——直接回答放最前面、明確的實體關係、清楚的產品定位。
技術基礎架構同步進行。AI 爬蟲看到的是乾淨、結構化、可被引用的網站版本。人類訪客看到的畫面完全一樣,不需要工程資源。FAQPage、HowTo、Product、Organization 等相關 schema、乾淨的實體定義和 llms.txt 設定全部代管。
回饋迴路直接對接你的 Google Search Console、GA4 和 AI 推薦流量數據。每篇文章都會根據哪些提示詞拿到引用、哪些 AI 推薦訪客轉換了、哪裡還有覆蓋缺口來評估,並隨著數據累積持續更新。
真正產生複利效應的就是這點。一家跟我們合作的 Series A 金融科技公司,92 天內 AI 能見度從 2.4% 成長到 12.9%,非品牌引用增加 152%,20% 的 demo 請求受到 AI 搜尋影響。一家亞洲的電商代營運商 86 天內在出口相關提示詞拿到 13.8% 的 AI 能見度,17% 的進線商機受到 AI 發現影響。
這些成果來自內容和基礎架構兩層同時運作的組合,單靠任何一層都做不到。
Grüns 用結構化 GEO 追蹤達成了什麼
消費健康品牌 Grüns 提供了結構化 AI SOV 量測能帶來什麼成果的最清楚案例之一。他們從競爭激烈的消費健康品類查詢中 2.0% 的 AI 聲量佔比起步,部署了 AI 可讀的支柱內容搭配結構化 schema,並在各平台追蹤提示詞層級的能見度。
方法很直接:他們精確找出哪些提示詞自己缺席、了解 LLM 用什麼來源回答這些問題,然後建立為擷取而設計的結構化內容。先量測,再根據量測結果執行。
常見問題
傳統聲量佔比衡量的是品牌在付費媒體、自然搜尋排名或社群媒體中的能見度。AI 聲量佔比衡量的是:在一組設定好的提示詞中,你的品牌出現在 AI 回覆裡的頻率相對於所有其他品牌。最大差異在分母:傳統 SOV 你是跟已知競品比;AI SOV 的競爭範圍必須涵蓋模型自然推薦的所有品牌,包括你沒預料到的。
業界數據一致指向二到八週開始看到能見度提升(首次出現在 ChatGPT 和 Perplexity 回覆中),有意義的業務影響通常在 60 到 90 天浮現。Grüns 案例在部署結構化、有 schema 的內容後 60 天內就看到可量測的 SOV 改善。Ramp(金融科技 SaaS)達成 7 倍 AI 能見度成長,一個月內拿到超過 300 個引用。速度很大程度取決於你是同時處理內容層和技術基礎架構層,還是只做其中一個。
資料來源
- Yotpo: LLM Optimization Guide
- McKinsey: New Front Door to the Internet
- Alex Birkett: AI Share of Voice Formula
- Sellm: AI Share of Voice Tracker API
- Senso: Share of Voice in Generative AI
- Zenith: AI Share of Voice Guide
- TryAnalyze: Profound AI Review
- AthenaHQ: Profound vs AthenaHQ Comparison
- Whitehat SEO: AEO Audit Guide
- Cognizo: Answer Engine Optimization
- Maximus Labs: Perplexity SEO Guide
- BrightEdge: AI Sentiment Data (AI Overviews vs ChatGPT)
- Averi AI: Track Brand Visibility in ChatGPT and LLMs
- GAIO Tech: AI Share of Voice Measurement Guide
- Trakkr: Measure Share of Voice in ChatGPT
- AthenaHQ: Grüns AI Search Case Study
- Profound: Funding Announcement ($20M)
- Profound: Semrush AI Visibility Toolkit Review
- Waikay: AI Brand Visibility and SOV Distortions
- Search Engine Land: Share of Voice Guide
- Evertune: How BrightEdge Users Can Improve AI Visibility