AI 引擎只抓伺服器回傳的 HTML,不會執行 JavaScript。這篇文章告訴你三步實戰:讓你的網站內容被 AI

你網站的 SEO 作得再好,如果 AI 爬蟲抓不到你的內容,就等於白作。這不是危言聳聽,而是目前所有大模型用來「訓練」與「回應」的 AI 引擎,如 GPTBot、ClaudeBot、PerplexityBot,全都有一個共通的行為模式:只抓伺服器回傳的原始 HTML,不執行 JavaScript。這意味著,如果你的網站內容是動態渲染的,AI 爬蟲看到的,只是空白的 HTML 標籤,而非你精心設計的內文與結構。

這篇文章要講的不是「你該不該用 JavaScript」,而是如何讓你的 HTML 結構本身,就足以被 AI 引擎看懂、抓取、引用。TrueLink 不只是幫你優化 SEO,我們幫你建構「被 ChatGPT 引用」的結構基礎。這篇文章將從三個層面,說清楚你現在要做的三個實戰步驟。

為什麼 HTML 可爬性決定你能不能被 AI 引用?

AI 引擎不是人類瀏覽器,它不會等畫面載入完、不會執行 JavaScript、不會重試。它抓到你的網頁後,只讀伺服器一開始回傳的 HTML,把裡面的純文字直接抽走,然後就走掉了。這聽起來像極了傳統的 SEO,但其實不一樣:AI 引擎不是要抓流量,而是要「引用」你的內容做為回應的來源。如果它讀不到你的內容,你的網站就等於從 AI 的知識庫裡「消失」了。

這不是「要不要」的選擇題,而是「要或不要死」的問題。你網站上的圖表、動畫、JavaScript 動態載入的內容,對 AI 爬蟲來說,都是空的。

TrueLink 的實作經驗顯示,我們在 blog 區塊中使用 SSR(Server-Side Rendering)生成 SVG 圖表與 Markdown 表格,確保每一張圖、每一段文字,都能被 AI 爬蟲讀取。相較之下,那些靠 JavaScript 擴散的圖片與動態內容,對 AI 來說,根本就不存在。你可以參考我們的實作文件:functions/routes/publicBlogPage.jspublic-blog-section-visuals.test.js,驗證我們的 raw HTML 可爬取性。

三步實戰:讓你的網站內容被 AI 引擎「看懂」

讓網站內容被 AI 爬蟲理解的三步驟讓網站內容被 AI 爬蟲理解的三步驟 · 把結構化資料寫進 HTML 使用 Schema.org 標註文章 · 包含必要的元數據 如作者、發布者和發佈日期等信息讓網站內容被 AI 爬蟲理解的三步驟1把結構化資料寫進 HTML使用 Schema.org 標註文章2包含必要的元數據如作者、發布者和發佈日期等信息
讓網站內容被 AI 爬蟲理解的三步驟

要讓 AI 引擎看懂你的網站內容,不靠 JavaScript,只靠 HTML。這不是退步,而是把結構當成內容的載體。以下三步,是我們在協助企業對齊 GEO(生成式引擎優化)的實務中,反覆出現的操作模式。

1. 把結構化資料寫進 HTML:Schema.org 是信任的起點

你網站的內容是「文章」,還是「亂碼」?這取決於你是否在 HTML 中正確標註了 Article 這個實體。Schema.org 是 Google、Bing、以及其他搜尋引擎與 AI 引擎共通的語法標準,如果你不寫,它就看不懂。

舉例來說,你的文章要被 AI 引擎引用,至少要包含:

  • @type: Article
  • 作者資訊(PersonOrganization
  • 發布者資訊(Organization
  • 發佈日期(datePublished

這些資訊不只是給搜尋引擎看的,更是AI 引擎判斷你內容可信度的依據。如果你的內容沒有明確的作者與發布者,AI 引擎會把它當作「無來源資料」,甚至直接忽略。

你可以在 schema.org 找到完整的實作範例。TrueLink 的 blog 區塊就完整實作了這些 schema,確保 AI 引擎一抓就能看懂我們的內容。

2. 用 FAQPage schema 抓住問答內容:讓 AI 引擎「切片」引用

FAQ 是一種結構明確、易於「切片」引用的內容形式。Google 長久以來支援 FAQPage schema,讓問答內容能在搜尋結果中以「富結果」形式呈現。但這對 AI 引擎來說,更有意義:它能直接從問答對中抽取資訊,作為回應的來源。

我們在 TrueLink 的 blog 中,對每一篇 FAQ 型內容,都實作了完整的 FAQPage schema。這讓我們的問答內容,不但能被 Google 搜尋引擎優先顯示,也能被 AI 引擎直接抓取與引用。

你可以參考 Google 的 FAQPage 文件,看看如何正確標註問答內容。這不僅是 SEO 的加分項,更是 GEO(生成式引擎優化)的基礎。

3. 不靠圖像,靠 SVG 與表格:讓 AI 讀得到「看得見的內容」

AI 爬蟲不能讀取圖像,但它能讀取 HTML 中的文字。這意味著,如果你的內容靠的是 JavaScript 動態生成的圖片,AI 爬蟲看到的只是空白。

TrueLink 的 blog 區塊中,所有視覺圖表與資訊圖表,都是以 SVG 或 Markdown 表格的形式直接寫在 HTML 中。這讓我們的內容,不論是問答、流程圖,還是對比表,都能被 AI 爬蟲讀取與引用。

這不是「退步」,而是把結構當成內容的載體。你可以參考我們的實作:functions/routes/publicBlogPage.jspublic-blog-section-visuals.test.js,看看我們是如何確保每一張圖、每一段文字,都能被 AI 引 🔍。


真實情境:當 AI 引擎問「這家公司的專業能力在哪裡」?

假設你是一家專業攝影公司的行銷總監。你的官網寫得很漂亮,有 JavaScript 動態生成的圖片、有動態載入的問答內容、有 JavaScript 控制的導覽列。但 AI 引擎抓到你的網站時,只看到空白的 HTML 標籤,沒有任何內容可參考。當使用者問「商業攝影團隊」時,AI 引擎找不到你的內容,也就找不到你。

這不是 SEO 的問題,而是HTML 的問題。如果你的內容不能被 AI 引擎讀取,你的網站就等於從 AI 的知識庫裡「消失」了。


重點:AI 爬蟲不是人類瀏覽器,它只讀 raw HTML

AI 爬蟲的關鍵特性和要求AI 爬蟲的關鍵特性和要求 · 不執行 JavaScript 只抓伺服器回傳的 HTML · 圖像與動態內容空白 網頁上的圖像和 JavaScript 動態內容對 AI 爬蟲來說都是空白 · 內容直接寫在 HTML 中 為了被引用,必須把內容直接寫進 HTML · Schema.org 的重要性 讓 AI 引擎看懂內容的關鍵AI 爬蟲的關鍵特性和要求 1不執行 JavaScript只抓伺服器回傳的 HTML 2圖像與動態內容空白網頁上的圖像和 JavaScript 動態內容 3內容直接寫在 HTML 中為了被引用,必須把內容直接寫進 HTML 4Schema.org 的重要性讓 AI 引擎看懂內容的關鍵
AI 爬蟲的關鍵特性和要求
  • AI 引擎如 GPTBot、ClaudeBot、PerplexityBot,不執行 JavaScript,只抓伺服器回傳的 HTML。
  • 你網站上的圖像、JavaScript 動態內容,對 AI 來說都是空白。
  • 為了被 AI 引擎引用,你必須把內容直接寫在 HTML 中。
  • Schema.org 是讓 AI 引擎看懂你的內容的關鍵。
  • FAQPage schema 讓問答內容更容易被切片引用。
  • SVG 與 Markdown 表格是讓 AI 讀得到「看得見的內容」的最佳做法。

繼續閱讀

如果你想更深入理解 AI 引擎如何抓取與引用內容,可以閱讀我們的其他文章:

  • [別再問「什麼是結構化資料」:把品牌從 AI 的「同業 A」裡救出來,只需三行 JSON-LD](/blog/ai-a-json-ld)
  • [AI 引用時代:一句話定生死的「X 是什麼」寫法,翻倍被摘錄機率](/blog/ai-geo-c2pa-trust-citation)
  • [當「公司報稅怎麼處理」被 AI 用來訓練模型:記帳業與會計師該做的事](/blog/ai-geo-schema-org-c2pa-citation-2)