當AI助手回答一個問題時,它會從少數幾個網頁中擷取句子并給出引用。你的頁面是否“可被擷取”,并不是玄學,而是一組可以從HTML標記里測量、打分、修復的機械屬性。
過去90天,微軟Bing網站管理員工具報告顯示,我的33個頁面獲得了1600次AI引用。但真正讓我意外的,是一次針對自家頁面的可提取性審計——主頁居然只得了65分(滿分100)。
![]()
問題出在五個UI卡片組件上。它們把標題渲染成了
和 標簽。這六個標題在視覺上完全不可見,既未改變一個像素,也沒刪掉一個詞,卻把我頁面在AI提取管道里的分數壓得一塌糊涂。修復很簡單:把這些標題降級為保留ARIA語義的段落標簽。一刀不切、一字不改,分數立刻跳到100。
這個結果讓我意識到,大部分關于“讓AI更好地抓取內容”的建議都集中在第一站(robots.txt、站點地圖、llms.txt)和第三站(結構化數據、實體信號),而第二站——提取(Extraction)——才是真正便宜、無聲失敗的環節。頁面檢索正常、歸因順暢,但提取很差,就永遠不會出現在AI回答里,而且沒有任何提示告訴你為什么。
AI引用管道:檢索、提取、歸因
一次AI引用其實是三部機器流程的最后一步,你的頁面必須三關全過:
檢索(Retrieve):引擎的爬蟲被允許抓取你的頁面,而且確實抓取到了。
提取(Extract):模型能在你的標記中找到干凈、自成一體的答案塊。
歸因(Attribute):引擎足夠確信是誰說的,才把你的名字放在引用旁邊。
大部分技術文檔和SEO建議都在強調第一關和第三關,但第二關的改進空間最大。因為它純粹是HTML工程問題,而且失敗是靜默的。一個頁面可能被完美抓取、完美歸因,但提取環節斷裂了,就永遠沒有露臉的機會。
所謂“可提取性”(Extractability),就是把第二關變成可度量的版本:一個解析器走在渲染后的HTML里,能不能在清晰限定的標題下找到自成一體的答案塊?這次審計用五個檢查項來打分,滿分100,任何一項都可以手工驗證。
75分以上落在“可提取”區間,40到74分屬于“部分可提取”,40分以下則是“不可提取”。這套區間來自我維護的《AI可見性就緒框架》,但那五個檢查本身與引擎無關——它們編碼了檢索增強系統如何按標題切塊、嵌入、并抽取與查詢匹配塊開頭句子的方式。
最關鍵的一點:審計統計的是渲染DOM里每一個
、 和 標簽,而不是你在CMS里寫了多少標題,而是你的組件庫產出了多少標題。這中間的落差,正是我那六個看不見的故障點所在。
審計前置:工具和頁面
動手之前需要三樣東西:一個能測量并部署的在線站點(我用的SvelteKit,所有修復方式都可以直接平移到React、Vue或純HTML);裝有 requests 和 beautifulsoup4 的 Python 3.10 以上環境;以及來自搜索控制臺的數據,用來選定要審計的頁面。我用的是Bing網站管理員工具,加上一個 GitHub Action 把檢查塞進CI流水線。
六個隱身標題是怎么被發現的
審計腳本遍歷渲染后的DOM,統計所有標題標簽,然后對比頁面上可見的語義區塊。很快,五個卡片組件的標題浮出水面——每一個都被封裝成
或 ,但在頁面上既沒有視覺層級,也并非內容的邏輯分段。它們是純裝飾性的標簽污染了標題樹,讓分塊器把連貫的段落切成碎塊,導致檢索系統找不到自包含的答案段。
修復方法一分鐘不到:把這些標題標簽換成帶有 aria-level 屬性的
,保留原有輔助功能語義,同時從標題統計中移除它們。提交、推送、CI綠燈,分數立刻變成滿分。沒有改一行CSS,沒有任何可見變化。
五步檢查法,把提取性變成硬指標
具體來說,審計包含五個檢查點,每一個都可以手工復查:
- 標題數量:頁面是否至少有一個 ?每個 下屬的 數量是否合理?
- 標題內容:每個標題是否對應一塊有意義的內容?那些空標題或重復標題會被識別出來。
- 答案塊:在每個標題下是否能找到至少一個自成一體的段落,足以獨立回答一個可能的問題?
- 信息密度:答案塊中的句子長度、專有名詞密度和事實密度是否足夠,而不是一堆模糊用語?
- 分塊完整性:同一塊內容是否被多余的標題截斷,導致提取的時候只拿到半截答案?
所有檢查都基于渲染后的HTML,因為AI爬蟲處理的不是你的源碼,而是瀏覽器看到的樣子。這也正是“看不見的標題”能夠藏身的原因。
把檢查塞進CI,讓分數不再回退
一次性修復不值得寫教程。真正有價值的是把審計變成每次構建的一部分。我寫了一個簡短的Python腳本,接收一個URL,返回0到100的分數,然后用 GitHub Action 把它掛在每次部署之前。如果任頁面的分數跌破75,構建直接失敗,拒絕部署。
這一步讓“可提取性”變成和單元測試一樣硬的東西。團隊里沒有人需要理解什么是標題污染,CI會替你記住。自那以后,再也沒有不可見的卡片標題溜進主頁。
AI可見性的便宜突破口
當下討論“內容被AI引用”時,大量精力砸在結構化數據和爬蟲權限上。這些當然重要,但第二關——提取——才是目前回報率最高的優化區間,因為它幾乎零成本,失敗方式極度隱蔽。
你甚至不需要猜測自己的頁面表現。跑一遍DOM統計,看看有多少標題是組件庫偷偷塞進去的,檢查一下每個標題下是否真有可以單獨成立的答案。很可能,分數從“部分可提取”跳到“可提取”,只需要改幾行HTML標簽。
這次審計讓我學到的另一件事是:AI引用并非不可捉摸。它有一組可度量的前序條件,而這些條件就躺在你的HTML里,等著被爬蟲讀取。與其期待下一次算法更新,不如先檢查一下,自己頁面上有沒有六個看不見的標題標簽。
特別聲明:以上內容(如有圖片或視頻亦包括在內)為自媒體平臺“網易號”用戶上傳并發布,本平臺僅提供信息存儲服務。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.