圖片與影片正在吃掉搜尋流量!品牌還只做文字 SEO 嗎?

圖片與影片正在吃掉搜尋流量!品牌還只做文字 SEO 嗎?

曾有一位品牌行銷主管,在會議上把筆電轉過來給我們看:內容團隊一週固定產出兩篇文章,整整堅持了三年,部落格文章總數在同業裡數一數二。

但我們在討論時發現後台數據中的自然搜尋流量在過去十個月掉了三成。他當場搜尋自家主力關鍵字,搜尋結果最上方的 AI 摘要引用了三個來源,其中一個是競爭對手的 YouTube 示範影片;而他們排在第七名、明明寫了一萬多字的完整攻略,連被引用的資格都沒有,他表示十分不解,為什麼比他們更不專業或者沒有完整分析的內容會被引用。

問題不在文章寫得不夠多,也不在文筆不夠好,而在於 Google 理解內容的方式已經改變:搜尋引擎現在同時「閱讀」文字、也在「觀看」圖片與影片,品牌行銷主管卻只提供了三種格式中的一種,因為他們覺得製圖很麻煩、製作影片成本又太高,基本上8成以上的文章都是沒有圖片的,但該有的數據資料都有,只是在過去我們都會認為圖片對爬蟲來說是沒有太多參考價值的,但現在AI爬蟲的進步,圖片和影片也是爬文中很重要的資訊線索,所以它們也學會進一步的解讀圖片、影片和文字的關係。

這篇文章我們會用 Google 官方數據與真實案例,來完整拆解圖片 SEO 與影片 SEO 的佈局方法。讀完你會知道:Alt 文字到底該怎麼寫、影片為什麼建議嵌入 YouTube 而不是丟進自家主機、結構化資料如何讓曝光翻倍,以及如何讓同一組素材在文字搜尋、圖片搜尋、影片搜尋與 AI 摘要四個戰場同時被找到。

只做文字seo已經不夠了

多模態搜尋不是未來式,Google 已經在「看」你的網站

我先把名詞跟大家介紹清楚,所謂多模態搜尋(Multimodal Search)指的是搜尋引擎不再只依賴文字比對,而是同時理解文字、圖片、影片、語音等多種內容格式,並且分析它們之間的關聯,來判斷一個網頁到底在講什麼。

這件事為什麼重要?因為它直接改寫了「排名」的定義:過去比的是誰的文字寫得完整,現在比的是誰能用最適合的格式回答問題,一支兩分鐘的示範影片,可能直接贏過一篇五千字的教學文。

舉個具體的例子就懂了,一名使用者拍下一張斷水的咖啡機照片,用語音問 Google說「這台為什麼突然不出水」,系統會先辨識出品牌與型號,再自動拆解成十幾個子查詢去比對全網的文字、圖片與影片,最後組合出一份含維修影片連結的答案,整個過程使用者一個字都沒打。

在這個流程裡,照片是查詢、語音是查詢、兩者組合起來的情境也是查詢;而在答案端,你的文章、你的產品圖、你的教學影片,全部都是「候選素材」。輸入與輸出同時多元化,就是多模態搜尋與傳統搜尋最根本的差別。

Google 於 2025 年 4 月宣布 AI Mode 整合 Gemini 的多模態能力:系統可以理解整個影像場景,包括物件之間的關係、材質、顏色與排列方式,再透過 query fan-out 技術同時發出多個子查詢。(資料來源:Google 官方部落格,2025/4

根據 Google 在 2025 年公布的官方數據,Google Lens 每月處理的視覺搜尋已超過 200 億次,是 2021 年的四倍以上;到了 2025 年 Google I/O 大會,官方進一步公布每月有超過 15 億人使用 Lens,用Google智慧鏡頭進行視覺搜尋,你一定很訝異吧!

而且視覺搜尋的主力使用者,正好是消費力快速成長的族群。Google 的統計指出 18 到 24 歲是 Lens 使用率最高的年齡層,這群人拿到一個陌生商品的第一反應不是打字查詢,是直接舉起手機拍照;搭配 2025 年初推出、讓使用者在任何畫面圈選內容就能搜尋的 Circle to Search,「先看到、再搜尋」可能正在取代「先想關鍵字、再打字」成為預設行為。
讓我們把場景換到台灣來,你可以想像這樣的一個日常:消費者在朋友家看到一張順眼的餐椅,拍照丟給 Google,三秒後畫面直接列出十個外觀相似的商品連結。你的商品有沒有出現在那個列表裡,跟你的文案寫得多好完全無關,只跟你的商品圖片能不能被搜尋引擎理解有關。但我還是要在聲明,不代表文章就不重要,反正正確的製作優質的SEO文章,才是這種多模態搜尋的最佳良藥。
同年 9 月,Google 再推出 visual search fan-out 技術:AI Mode 結合 Gemini 2.5,不只辨識照片裡的主要物件,連次要物件與細節都能拆解成查詢。對品牌來說,這代表你網站上的每一張圖片,都已經是搜尋引擎的分析對象,而不是裝飾品。
文字內容的優勢沒有消失,但「只有文字」的內容組合,正在快速失去競爭力。 我們把兩個時代的差異整理成下表:

比較面向 傳統文字搜尋時代 多模態搜尋時代
Google 理解的對象
網頁文字、連結
文字、圖片、影片與其關聯
排名競爭單位
一篇文章
一整組內容素材
使用者輸入方式
打字
打字、拍照、上傳圖片、語音
曝光位置
十個藍色連結
傳統排名、圖片搜尋、影片輪播、AI 摘要

看懂上面這張表,就等於看懂了本文的核心,恭喜你!

品牌的搜尋競爭,已經從「一篇文章的排名」變成「一組素材的總曝光」。

接下來我們一個戰場一個戰場拆解,先從門檻最低的圖片開始吧。

文字只是入場券,真正的戰場是整個場景

我們檢查過非常多客戶網站,發現一個共同現象:老闆花了大錢請攝影師拍形象照,圖片美得可以直接當桌布,但在搜尋引擎眼中,這些圖片是「啞巴」。檔名叫 IMG_8274.jpg,沒有 Alt 文字,沒有前後文說明,Google 只知道這裡有一張圖,不知道圖裡是什麼、跟這頁內容有什麼關係。

很多人以為圖片沒帶來流量是因為「我們產業沒人用圖片搜尋」,這個歸因幾乎都是錯的:真正的原因是你的圖片根本沒有進入比賽場,裁判連你的號碼布都看不到。視覺內容的商業影響力其實有明確數據支撐:根據 Think with Google 在 2025 年公布的調查,50% 的線上購物者表示圖片影響了他們的購買決策

文字的正確寫法:寫給看不到畫面的人聽

Alt(替代文字)原本是無障礙設計的一環,讓螢幕閱讀器能對視障使用者描述圖片,而這恰好也是搜尋引擎理解圖片最直接的線索。判斷 Alt 寫得好不好,有一個我們常用的土方法:把圖片遮起來,只唸 Alt 文字給同事聽,對方能不能大致想像出畫面呢?

以一張健身器材的商品圖為例,三種寫法的差距一目了然:

  • 錯誤示範一(空白或無意義):alt=““、alt=”圖片1”,等於放棄比賽資格
  • 錯誤示範二(關鍵字堆疊):alt=“健身器材 跑步機 推薦 便宜 台中”,可能被視為垃圾訊號
  • 正確示範(描述畫面加上自然關鍵字):alt=“家用折疊跑步機收納後直立靠牆的實拍圖,佔地約半坪”,只看到描述也可以大概知道這張圖片的畫面是什麼對吧?

寫 Alt 的原則只有兩條:先如實描述畫面,再讓關鍵字自然出現在描述裡;長度控制在一句話以內,「不需要」塞進整段行銷文案,反而會造成反效果。

比 Alt 更重要的四件事:Google 怎麼判斷一張圖的價值

Alt 只是入場券,Google 對圖片的理解遠不止於此,搭配 Google Search Central 的官方圖片指南與我們的實務經驗,一張圖片能不能在圖片搜尋與 AI 摘要中被撿走,取決於整個「場景」:

  • 檔名與路徑:上稿前把jpg 改成 foldable-treadmill-storage.webp,用英文關鍵字描述內容,這是成本最低的優化
  • 周邊文字:圖片緊鄰的段落與圖說(caption)是 Google 判斷圖片主題的重要依據,圖文必須互相呼應,禁止文不對圖
  • 原創性:直接抓圖庫照片的識別度趨近於零,自己拍的實景照、自己做的資訊圖表,才有機會成為搜尋結果裡的獨家答案
  • 載入速度與格式:轉存 WebP、設定合理尺寸,一張 12MB 的原始輸出圖足以拖垮整頁體驗,速度議題可延伸閱讀我們的〈高端網站規劃指南:品牌質感、SEO 流量與 Core Web Vitals

關於原創性,我想多說兩句,因為這是市面上多數教學不會告訴你的成本真相。同一張圖庫照片可能同時出現在幾百個網站上,Google 早就看過幾百次,它既不會把這張圖當成你的獨家內容,也不會在圖片搜尋中優先展示第三百零一個使用者;反過來說,一張用手機認真打光拍攝的產品實照,在搜尋引擎眼中是全網唯一的內容,起跑點完全不同。

圖庫照不是不能用,而是要「分工」,例如最用在氣氛營造、段落過場的圖片可以交給圖庫,但承載搜尋意圖的關鍵位置,例如商品主圖、步驟示範、比較圖表,一律使用原創素材,若你的圖片本身具有授權價值(例如攝影作品或設計圖),還可以進一步透過 ImageObject 標記或 IPTC 中繼資料標註授權資訊,讓圖片在 Google 圖片搜尋中顯示「可授權」標籤,多開一條商業曝光管道。

視覺品質的投資報酬率,有一個很有說服力的國際數據:根據 Airbnb 官方公布的統計,使用專業攝影照片的房源,房東收入平均高出 21%,預訂量高出 19%。同一間房子、同一個價格,差別只在照片,這就是視覺內容的商業重量。

透過埋入這五個訊號讓圖片可以被爬蟲看得懂

以下是根據前面的原則整理成可以直接執行的檢查清單,建議內容團隊每次上稿前過一遍:

  • 檔名是否為英文關鍵字命名,而非相機流水號?
  • Alt 是否描述了畫面內容,且自然包含一個關鍵字?
  • 圖片前後是否有呼應的說明文字或圖說?
  • 是否至少有一張原創圖片(實拍或自製圖表)?
  • 是否已轉 WebP、或者壓縮至合理大小?

這五項全部做到,一篇文章多花的時間不超過二十分鐘,卻等於幫每張圖片報名了圖片搜尋與 Google Lens(智慧鏡頭) 兩個額外的曝光戰場。

多了兩個曝光戰場~

影片 SEO:為什麼我們建議影片放 YouTube,而不是自家主機

聊到影片,客戶最常問我們的第一個問題是:「影片要上傳到自己網站,還是放 YouTube?」我們的答案十年來沒變過,而且現在比以前更加篤定:請把影片上傳到 YouTube,再用嵌入(embed)的方式放進網站文章,盡量不要把影片檔直接丟進自家主機空間。

自家主機與 YouTube 嵌入的差距,比你想的更大

理由有三個層面。第一層是「技術面」:影片檔動輒數百 MB,放在自家主機會吃光頻寬、拖垮網頁載入速度,行動裝置上還會因為缺少自適應串流而不斷轉圈圈,等於花錢做了一個趕客的功能。

兩種做法的實際差異,我整理成下表方便比較:

比較面向 影片檔放自家主機 上傳 YouTube 後嵌入網站
主機成本
頻寬與空間費用隨流量暴增
零,由 YouTube 承擔
播放體驗
無自適應串流,行動端易卡頓
依網速自動調整畫質
額外曝光
僅限自家網站
YouTube 站內搜尋加 AI 引用生態
AI 摘要引用機會
極低
引用主力來源

觀看數不到一千的影片,為什麼還能被 AI 引用

第二層是曝光面,這也是多數品牌沒算到的帳。YouTube 本身就是全球第二大搜尋引擎,影片放上去等於免費多了一個搜尋入口;更關鍵的是 AI 搜尋時代的引用生態:根據 BrightEdge 在 2025 年發布、橫跨 ChatGPT、Google AI Overviews、Perplexity 等平台的 3,000 萬筆引用來源分析,YouTube 被 AI 搜尋引用的次數,是其他所有影音平台的 200 倍,在 Google AI 摘要中的影片引用佔比約三成。

第三層是機會面,這個數據我們第一次看到時也很意外:同一份 BrightEdge 研究發現,被 AI 搜尋引用的 YouTube 影片中,有 41% 的觀看數低於 1,000 次。 AI 引擎挑選引用來源時,看重的是內容結構清不清楚、能不能直接回答問題,而不是訂閱數與觀看數,這對沒有百萬網紅預算的中小品牌來說,是一扇還沒被擠爆的門。

後續追蹤研究也指出,AI 引用的 YouTube 影片有 94% 是長影片(非 Shorts),長度甜蜜點落在 5 到 20 分鐘之間;教學、比較、案例拆解類型的影片引用表現最好。(資料來源:BrightEdge「YouTube Presence in AI Search」報告,2025)

一篇文章一支影片就好,而且放在後半段

至於嵌入的做法,我們給客戶的標準建議很簡單:

「一篇文章最多嵌入一支影片就好,而且放在文章後半段。」

原因是影片 iframe (全名為 Inline Frame,內嵌頁框)會有載入成本,放太多支會拖慢頁面;如果放在後半段,則是讓讀者先透過文字與圖片建立理解,影片作為「看完想更深入」的延伸示範,完讀率與觀看時長都會比開頭就塞影片來得好,比較能有效降低跳出率。

也不是每篇文章都需要影片,硬拍反而浪費預算。我們的判斷標準是一個看這個主題有沒有「用看的比用讀的快」的環節?例如像安裝流程、操作示範、前後對比、空間感呈現等等的這些適合影片呈現;如果是純觀念解析、法規整理、費用比較,文字加表格就很足夠,把拍片預算留給真正需要畫面的主題

影片本身的優化,記住三個對 AI 引用影響最大的動作:

  1. 在影片說明欄加上時間戳記章節(Google 會將其轉為搜尋結果中可點擊的關鍵時刻)
  2. 上傳完整字幕檔而不是依賴自動字幕
  3. 影片標題直接回答一個具體問題而不是取品牌口號式的名字

結構化資料:把視覺內容翻譯成 Google 聽得懂的語言

結構化資料(Structured Data / Schema Markup)是一段加在網頁原始碼裡、使用者看不到的標記,用途是明確告訴搜尋引擎:這一頁有一支影片、它的標題是什麼、長度多久、縮圖在哪裡。它為什麼重要?因為搜尋引擎雖然越來越會「看」,但你主動遞上一份規格清楚的說明書,永遠比讓它自己猜來得可靠,而且這是取得縮圖、時間軸等豐富搜尋結果(Rich Results)版位的入場資格。

效果不是理論,Google 自己就發布過完整案例。印尼影音平台 Vidio 導入 VideoObject 結構化資料並修正影片網址的抓取問題後,一年之內影片在 Google 搜尋的曝光成長約 3 倍,點擊成長接近 2 倍,而同期影片數量只增加了三成,成長主要來自「同一批內容被 Google 看懂了」。

像後起之秀的Vimeo 在 2022 年為全平台超過 7.5 億支影片加上 VideoObject 與 Clip、SeekToAction 標記,讓影片章節能以「關鍵時刻」(Key Moments)的形式直接出現在 Google 搜尋結果的時間軸上,使用者點擊任一段落標籤,就會跳轉到影片的對應秒數。

品牌網站常用的視覺內容標記,我們整理成下表:

標記類型 用途 適用情境
ImageObject
描述圖片內容、作者與授權
原創圖表、產品攝影、新聞圖片
VideoObject
描述影片標題、長度、縮圖、上傳日
所有嵌入影片的頁面
Clip / SeekToAction
標記影片章節與跳轉秒數
教學型長影片,啟用關鍵時刻
Product
標記商品價格、庫存、評價
電商商品頁,同步曝光於 Google Lens

有一個常見誤解要先打破:影片放 YouTube 之後,文章頁還需要標記嗎?一定是需要的。YouTube 會處理它站內的曝光,但你網站上這一頁「含影片的文章」要在 Google 搜尋中取得影片豐富結果,仍建議在該頁加上 VideoObject,把 embedUrl 指向 YouTube 影片,這樣文字排名與影片版位才能疊加在同一個網址上。

實作時務必遵守一條紅線:結構化資料描述的內容,必須與頁面上使用者實際看得到的內容一致。標記與內容不符,輕則豐富結果失效,重則被 Google 視為垃圾標記處理。(資料來源:Google Search Central 結構化資料指南)

很多人以為:「裝了 SEO 外掛,結構化資料就自動搞定了。」我們實際幫客戶檢查網站後發現,這句話只對了一半。

外掛確實會幫你產出基本的標記,但它比較像一台只負責印名片的機器:名片印出來了,至於上面的電話打不打得通,它不管。

最常見的三種「打不通」狀況是「影片縮圖的網址失效」、「標記寫的標題跟頁面上的標題對不起來」、「圖片網址放一陣子就過期」,Google 想抓檔案卻撲了空,這三種問題外掛都不會跳出任何提醒,而你的影片縮圖與時間軸遲遲沒出現在搜尋結果上,原因多半就出在這裡。

所以我們的建議是:
WordPress 的 SEO 外掛可以幫你起步,但不能幫你收尾,建議每次上稿後,花三分鐘把網址貼進 Google 的複合式搜尋結果測試工具,看看它讀不讀得懂;再定期打開 Search Console 的影片索引報表,確認 Google 真的有把影片收進去。前面提到的 Vidio 就是這樣做的:他們靠這份報表才發現整個平台的影片都有抓取問題,修好之後曝光才翻了三倍。

Google 複合式搜尋結果測試工具驗證 VideoObject 標記通過的畫面

圖文影片的組合,如何決定你在 AI 摘要裡的能見度

前面三個戰場各自獨立,但真正的決勝點在它們的交集處:AI 摘要(AI Overviews)。

根據 Semrush 在 2025 年 3 月的統計,AI 摘要已出現在約 13% 的搜尋結果中,部分研究估計至 2025 年底比例達到 18%;同時約 58.5% 的搜尋以零點擊收場,使用者在搜尋結果頁就得到答案。

零點擊聽起來好像很悲觀,但換個角度看,當點擊變少,「被 AI 摘要引用」本身就成了新的曝光戰場,而多模態內容正是這個戰場的入場券。BrightEdge 的追蹤報告就直接指出,2025 年初以來 YouTube 影片在 Google AI 摘要中的引用量成長超過 25%;其中教學型(How-to)影片的引用量暴增 651%,視覺示範類影片成長 592%。

再看查詢類型的分佈,你就知道該把力氣放在哪。同樣根據追蹤統計,AI 摘要出現的查詢中有將近九成屬於資訊型問題,也就是「怎麼做、怎麼選、為什麼」這類問題;換句話說,品牌部落格與教學影片經營的內容行銷主題,正好是 AI 摘要覆蓋密度最高的區域,做與不做的能見度差距會持續拉大。

圖片被 AI 摘要採用的機制也值得理解:AI 引擎不會憑空插圖,它會從被引用網頁中挑選與答案語意相符的圖片一併展示。這代表你的自製圖表若恰好視覺化了某個常見問題的答案,例如「跑步機馬力對照表」,它就有機會連圖帶連結一起出現在 AI 摘要裡,等於免費的品牌看板

這組數據背後的邏輯,跟 Google 近年強調的 EEAT(經驗、專業、權威、可信度)一脈相承:一支實際動手示範的影片、一張第一手拍攝的實景照,是「真實經驗」最難造假的證據,AI 引擎在挑選引用來源時自然偏好它們。

AI 摘要引用來源示意:同一個問題下,網頁文章、自製圖表與 YouTube 影片同時被引用展示,標出 How-to 影片引用成長 651% 的關鍵數據

這一點在生成式 AI 大量產出文字的 2026 年格外關鍵。純文字內容可以在幾分鐘內被 AI 工具量產,全網相似度越來越高,搜尋引擎越來越難從文字本身分辨誰有真本事;但一段拍攝你實際操作機台的影片、一張標了尺寸的產品拆解實照,量產工具做不出來,這些視覺內容因此成為品牌證明「我真的做過」的最強籌碼。關於 Google 如何辨識真人內容與 AI 量產內容,我們在拒絕 AI 味內容!SEO/GEO/AEO 趨勢解析裡有完整拆解,兩篇搭配著看會更清楚全貌。

落到執行面,想提高內容被 AI 摘要引用的機率,圖文影片要這樣配合:

  • 文章每個 H2 段落直接回答一個具體問題,段落開頭給結論,方便 AI 擷取
  • 關鍵數據與比較用表格與自製圖表呈現,並在圖說中重述結論,讓圖片本身可被引用
  • 一支 5 到 20 分鐘的示範影片嵌在文章後半段,說明欄加時間戳記,讓 AI 能引用到特定段落
  • 全頁佈署對應的結構化資料,確保 AI 讀到的與使用者看到的一致

同一個問題,你同時用文字、圖表、影片三種格式回答,就等於在 AI 引擎的來源池裡投了三張票,這是純文字內容永遠做不到的疊加效果。

我們最常在健檢時看到的五個視覺內容地雷

方法講完了,接著講失敗案例,以下五個地雷,是我們替客戶網站做健檢時出現頻率最高的問題,每一個都會讓前面的努力打折,建議對照自己的網站逐項檢查。

地雷一:形象輪播圖把文字做進圖片裡

首頁大圖上的品牌標語、優惠訊息直接壓在圖片檔上,搜尋引擎讀不到、螢幕閱讀器唸不出,改版換圖時舊訊息還會殘留在快取裡。正確做法是圖歸圖、字歸字,文字用 HTML 疊在圖片上方

地雷二:把 Alt 當關鍵字倉庫

一張圖的 Alt 塞了八個關鍵字,以為是加分,實際上是把無障礙欄位變成垃圾訊號;Google 的圖片指南明確建議 Alt 應描述圖片內容,堆疊關鍵字可能導致網站被判定為垃圾內容。

地雷三:影片用連結貼上,而不是嵌入

文章裡放一行「影片請點這裡」的純文字連結,讀者被帶離網站,頁面本身也無法取得影片豐富結果的資格;正確做法是使用 YouTube 提供的嵌入語法,讓影片在你的頁面內播放。

地雷四:縮圖與影片內容不符

為了點擊率做了誇張的縮圖,結果與影片實際內容落差太大,觀眾秒退,除了留存數據變差之外,標記中的縮圖若與內容不符,也會直接違反 Google 的結構化資料規範。所以千萬不要成為標題黨和縮圖檔,這些都會讓你的品牌被貼上不值得信任的標籤。

地雷五:只做新文章,放著舊文章不管

多模態優化最高投報率的對象,其實是那些已經有排名、只缺視覺素材的舊文章;替一篇排在第五名的舊文補上原創圖表與示範影片,通常比從零寫一篇新文章更快看到流量變化唷。

五個地雷有一個共同點:它們都不會讓網站直接掛掉,也不會跳出任何錯誤訊息,所以可以安靜地存在好幾年而沒人發現。這正是視覺內容問題最麻煩的地方,你不會收到警告,只會看到流量曲線緩慢下滑,然後把原因歸咎到演算法或景氣。

其實自我健檢的方式也不難,只要打開 Search Console,比對「網頁」與「圖片」兩種搜尋類型的成效報表,再檢查影片索引報表有沒有內容。如果你的圖片搜尋曝光趨近於零、影片報表一片空白,代表這些戰場你根本還沒報名,上面的地雷至少踩中了兩個以上。

五個視覺內容地雷,現在就能馬上修正

多模態內容策略:一組素材,四個搜尋戰場

講到這裡,你是不是會覺得工作量可能要變成三倍以上:又要寫文章、又要做圖、又要拍片。我們經手客戶做內容規劃多年的實戰結論「恰好相反」,多模態佈局的重點不是產量翻倍,而是把「一次內容投資」拆解到四個戰場重複使用,真正改變的是規劃順序。

傳統流程是先寫完文章,再回頭找圖庫湊圖,對吧?但多模態流程則是在題目確定的當下,就先問三個問題:這個主題有哪些畫面非拍不可?哪些數據做成圖表比文字更有力?哪個步驟用三分鐘影片示範,勝過三千字描述?先規劃畫面,再動筆寫字。

我們來用一個假設情境說明整套流程怎麼跑。假設一間台中的健身器材電商要經營「家用跑步機挑選」這個主題:

  • 產出一篇完整挑選指南文章,鎖定「跑步機推薦」等文字搜尋需求
  • 拍攝六張實景圖:折疊收納實拍、面板近照、與市售機型的佔地比較,全部依前述規範命名並撰寫 Alt,進攻圖片搜尋與 Google Lens
  • 錄一支 8 分鐘的「安裝與收納示範」影片上傳 YouTube,加上章節時間戳記,嵌入文章後半段,進攻影片搜尋與 AI 摘要引用
  • 文章頁佈署 VideoObject 與 Product 結構化資料,讓商品資訊同步曝光於 Google Lens 的購物結果

同一次拍攝、同一份腳本、同一組數據,最後在文字搜尋、圖片搜尋、影片搜尋、AI 摘要四個戰場同時掛號。以內容行銷的投資效率來說,這比多寫四篇純文字文章划算多得多。

成效追蹤也要跟著換儀表板。過去只看關鍵字排名與整體流量,現在建議把 Search Console 的搜尋類型切開來看:網頁、圖片、影片三種報表分別追蹤曝光與點擊,再搭配 YouTube 數據分析裡的「流量來源:Google 搜尋」欄位,你才能看出每個戰場各自貢獻了多少,也才知道下一季的素材預算該往哪裡加碼。

如果你的團隊人力有限,沒辦法一次到位,我們建議照這個順序排優先級:先補圖,再上標記,最後才拍片。補齊既有文章的檔名、Alt 與原創圖表,一個人一週可以處理十到十五篇;佈署與驗證結構化資料是一次性的技術工作,交給工程師或外部 SEO 服務約一到兩週完成;影片產製成本最高,先從一個月一支、鎖定搜尋量最大的教學主題開始就好。

三個階段各自都能獨立產生效果,不必等全部完成才上線。這也是我們評估佈局方式的一貫原則:與其追求一步到位的完美專案,不如讓每個階段的成果先進場比賽,邊跑邊補。

順帶提醒經營實體店面的讀者:多模態搜尋的邏輯同樣適用於 Google 商家檔案,商家照片的品質與更新頻率直接影響在地搜尋與地圖曝光,完整做法可以參考我們的Google 商家優化全攻略〉。

一組素材拆解到文字搜尋、圖片搜尋、影片搜尋、AI 摘要四個戰場的內容複用流程圖

視覺內容的佈局成本,遠低於流量消失後的補救

回到開頭那位行銷主管的故事,他們後來做的事情其實不多:沒有增加文章產量,而是花一季時間替既有的五十篇主力文章補齊原創圖片與 Alt、挑出十個最適合影像示範的主題各拍一支影片嵌入文章、全站佈署影片結構化資料,三年累積的內容資產並沒有浪費,只是終於被 Google「看見」了完整的樣子。

這正是我們想留給你的最後一個觀念:

多模態搜尋優化不是打掉重練,而是讓既有內容多長出幾個曝光面,大部分工作是補標記、補圖、補一支影片,而不是重寫。對於我們這樣每天檢查客戶網站的 SEO 公司來說,2026 年評估一個網站的健康度,早就不只看文字排名,而是看整組素材在四個戰場的總能見度。

預算層面方面,多模態佈局初期幾乎不需要額外的 SEO 費用,補檔名、寫 Alt、加標記都是既有人力就能執行的工作;真正需要編列預算的只有影片產製,而一支手機拍攝、剪輯乾淨的示範影片,成本遠低於多數老闆的想像。建議先用零成本的項目驗證成效,再決定要不要加碼,是我們推薦的布局節奏。

如果你正在評估 SEO 服務,或是檢視現有合作對象,建議把這題加進你的提問清單:「你們如何處理我的圖片與影片?」對方若只談關鍵字與外部連結,隻字不提視覺內容與結構化資料,他賣給你的可能是上一個時代的搜尋引擎優化。

搜尋引擎已經睜開眼睛了,別再讓你的品牌只剩一種聲音。

行銷主管與內容團隊替既有文章補上圖片、影片與結構化資料後,看著後台圖片與影片搜尋流量曲線回升的情境畫面

關於本文

本文由加乘數位行銷資深 SEO 顧問 Tina 撰寫,內容基於多年協助台灣品牌與電商規劃內容策略、監測文字與圖片影片多渠道搜尋數據的實戰經驗,並結合 Google 官方多模態搜尋技術發展(AI Mode、Google Lens)與 BrightEdge、Semrush 等國際公開研究的長期追蹤,旨在幫助已投入內容經營的品牌行銷人員與企業主,建立對「多模態搜尋佈局」的完整認知,理解圖片 SEO、影片 SEO、結構化資料與 AI 摘要引用機制,如何在同一套內容策略裡整合規劃,讓每一次內容投資同時進攻文字、圖片、影片與 AI 摘要四個曝光戰場。

本文適合品牌行銷人員、內容團隊、電商品牌與重視搜尋曝光的企業經營者參考。如有視覺內容健檢、結構化資料佈署或內容行銷策略相關問題,歡迎進一步諮詢。

如需轉載,請註明出處並附上原文連結。

👇【文字、圖片、影片的SEO不知道如何整合嗎?歡迎聯絡我們,協助你做好全方位的SEO👇

文章內容目錄