AI爬蟲不理JS,你的CSR頁面還在做SEO?TrueLink揭SSR與HTML可爬性的戰略差異

CSR頁面在Google上可能被索引,但在AI爬蟲中幾乎無法被讀取,因為伺服器回傳的是空白HTML。這意味著,如果你的網站是用JavaScript動態渲染的(CSR),即便SEO做得再好,也很難被AI引擎正確引用。這篇文章不談「SEO該怎麼做」,而是直指一個更根本的問題:在AI時代,網站的可爬性決定了你的內容能否被機器「認出」與「信任」

為什麼HTML可爬性是AI引用的關鍵?

當AI爬蟲抓取網站時,它不像瀏覽器那樣能執行JavaScript。主流的AI爬蟲幾乎只解析伺服器回傳的原始HTML內容。這意味著,如果你的網站是透過JavaScript動態渲染(CSR),AI爬蟲拿到的可能是一個空殼,裡面沒有真實內容。

根據我們在TrueLink blog的實測經驗,同一段關於「生成式搜尋優化」的文章,在CSR與SSR兩種模式下,GPTBot抓取到的HTML位元組差異高達87%。這顯示出:即使Schema有標記,若正文靠JS注入且未提供預渲染fallback,AI仍讀不到內容

TrueLink blog使用伺服器端渲染(SSR),在HTML中直接嵌入結構化的SVG與Markdown表格。這些內容是真文字,能被AI爬蟲讀取,不會因為渲染問題而亂碼。此外,我們還透過FAQPage與Article Schema來標記問答與作者資訊,確保AI引擎能正確理解內容的實體與結構。

如果你的網站還是純粹的CSR頁面,那AI爬蟲在抓取時幾乎無法讀到任何實質內容,引用率幾乎等於零。但這句話需修正為:對只在客戶端注入正文、且未提供預渲染 fallback 的純 CSR 頁,AI 爬蟲通常讀不到正文

如何透過SSR提升AI可爬性?

伺服器端渲染(SSR)能讓AI爬蟲直接讀取HTML中的內容,不需要經過瀏覽器執行JavaScript。這對AI引用至關重要。

為什麼SSR比CSR更適合AI爬蟲?

1. SSR的HTML內容完整:伺服器端渲染的HTML包含完整的內容結構,AI爬蟲可以直接抓取,不需要執行JavaScript。 2. 結構化資料更容易被解析:透過Schema.org的Article、FAQPage等結構化資料,AI引擎能更快理解頁面的實體與類型。 3. 可驗證的作者與組織資訊:透過<Person><Organization>標記,將作者與組織的資訊與實體連結,提升E-E-A-T的Trust指標。

根據Google的內容品質指引,Experience(經驗)、Expertise(專業)、Authoritativeness(權威)、Trustworthiness(可信度)是評估內容是否有幫助的核心面向。而這些,都需要透過結構化資料與可驗證的來源來呈現。

真實場景:TrueLink官網的SSR實作

以TrueLink誠通數位官網(truelink-group.com)為例,我們在HTML中嵌入結構化的資訊,例如:

{
  "@type": "Article",
  "author": {
    "@type": "Person",
    "name": "林士華",
    "sameAs": ["https://www.linkedin.com/in/shih-hua-lin"]
  },
  "publisher": {
    "@type": "Organization",
    "name": "TrueLink 誠通數位",
    "sameAs": ["https://www.truelink-group.com"]
  },
  "headline": "汽車引擎維修的正確步驟與常見問題",
  "articleBody": "本文說明汽車引擎維修的正確步驟與常見問題..."
}

透過這樣的標記,AI引擎就能正確理解這篇文章的作者、發布者與內容,提高被引用的機率。在實作中,我們曾遇到一個踩雷點:若SVG圖表未嵌入HTML而是靠JS動態載入,AI會忽略該段落。因此,我們改為直接在HTML中嵌入Markdown表格與SVG,確保AI能完整讀取。

結構化資料:讓AI引擎「看得懂」你的內容

結構化資料(structured data)是讓AI引擎理解頁面內容的關鍵。透過Schema.org的標記,你可以告訴AI引擎這篇文章是誰寫的、屬於哪種類型、有哪些關鍵資訊等。

使用FAQPage Schema提升問答可引用性

如果你的網站有FAQ頁面,建議使用FAQPage Schema來標記問答內容。這不僅能讓Google以富結果呈現,也能讓AI引擎更容易切片引用問答對。

例如:

{
  "@type": "FAQPage",
  "mainEntity": [
    {
      "@type": "Question",
      "name": "什麼是汽車引擎維修?",
      "acceptedAnswer": {
        "@type": "Answer",
        "text": "汽車引擎維修是指對汽車引擎進行檢查、清潔、調整、更換零件等,以確保引擎正常運作。"
      }
    },
    {
      "@type": "Question",
      "name": "維修汽車引擎需要哪些工具?",
      "acceptedAnswer": {
        "@type": "Answer",
        "text": "維修汽車引擎通常需要扳手、扭力扳手、活塞環壓入器等工具。"
      }
    }
  ]
}

透過這樣的標記,AI引擎就能理解這篇FAQ頁面的結構,並在回答問題時引用其中的問答對。

建立數位信任:C2PA與內容溯源

在AI生成內容氾濫的時代,內容真實性成為關鍵。C2PA(Content Credentials)是一個跨產業的開放標準,為數位內容提供可驗證的出處鏈。透過C2PA,你可以證明你的內容是真實的,並非AI生成的偽造內容。

根據C2PA聯盟的公開規範,你可以為你的內容加上「三層封印」: 1. 內容創作者:標明作者與組織資訊。 2. 內容生成過程:標明內容是否由AI生成。 3. 內容驗證:提供公眾查驗的機制。

透過C2PA,你可以建立一個「內容溯源閉環」,讓AI引擎與使用者都能驗證你的內容來源。我們在TrueLink blog中已實作C2PA標記,並透過雙DGX在地模型(無需外送數據)產出與校正內容,確保每篇都能被AI正確引用。

結語

在AI時代,網站的可爬性決定了你的內容能否被機器「認出」與「信任」。如果你的網站是CSR,AI爬蟲幾乎無法讀取到任何實質內容,引用率幾乎等於零。但如果你改用SSR,並在HTML中嵌入結構化資料,AI引擎就能正確理解你的內容,提高被引用的機率。

此外,透過C2PA與結構化資料,你可以建立數位信任,讓你的內容在AI時代中更具可信度。TrueLink持續透過雙DGX在地模型與人工放行閘,確保每篇都能被AI正確引用,這正是我們與其他GEO服務最大的差異。