文章 / 觀點與方法
8 min給工具使用者

Claude 可以看影片嗎?影片摘要、逐字稿與畫面分析教學

Claude 能直接上傳影片嗎?整理逐字稿與關鍵畫面的差別、時間碼摘要提示詞、證據核對方法與官方支援限制,附教學材料。

Aaron Huang系統、產品與 AI 實作
文章主題封面
教學配圖;證據與限制以正文為準。
本文目錄

想用 Claude 整理影片,先確認它實際拿到什麼。逐字稿能支持「講者說了什麼」,關鍵畫面才有機會補上投影片、操作介面與圖表;只有影片網址,不能直接當成它已經看完整支影片。

這篇把影片摘要拆成可以逐步檢查的流程:整理逐字稿、挑選畫面、要求時間碼,再回原始資料核對。你也可以下載教學用的對照材料,練習判斷一句摘要究竟有沒有證據。

練習材料:下載逐字稿、示意畫面與核對表。材料為本篇自製教學情境,並非真實會議紀錄、實際影片擷取或 Claude 實測輸出。

Claude 可以直接讀取影片檔嗎?

不要把「能分析影片相關資料」和「原生支援影片檔」混在一起。截至 2026 年 9 月 9 日查閱的 Claude 官方檔案上傳說明,支援清單列出文字文件與 JPEG、PNG、GIF、WebP 等圖片,沒有列出 MP4。本文因此採用逐字稿加圖片的流程,不承諾一般聊天視窗能直接處理 MP4。

這個判斷限定於該官方文件描述的上傳入口,不是宣稱所有 Claude 產品、第三方工具或未來版本都不能處理影片。使用前,先確認你操作的是 Claude 網頁聊天、Claude Code,還是外部服務;再看該入口實際允許的輸入。

網路上名為 watch video 的 Skill,也可能先透過其他程式取得字幕或抽取畫面,再把結果交給模型。功能名稱不能證明完整影片已被讀取。你真正需要知道的是:讀了哪些資料、涵蓋哪些時間,以及哪些資訊沒有進入模型。

逐字稿、字幕和畫面,分別能回答什麼?

輸入資料要跟問題對應。若你只想知道訪談主張,逐字稿可以是起點;若你想重現軟體操作,只有講者說的「按這裡」,通常不夠。

依問題選輸入,而不是一次上傳最多資料
你想知道優先準備仍要注意
講者提出哪些理由有時間碼的逐字稿人名、否定詞與數字是否轉錯
按鈕在哪、如何操作逐字稿加操作前後畫面中間是否漏掉必要步驟
圖表中的數值清楚圖表截圖與時間點座標軸、單位、期間與註解
連續動作與變化更密集的關鍵畫面,必要時人工回看靜態抽樣無法證明每一秒發生什麼

字幕也不一定等於完整逐字稿。它可能省略贅詞、重疊發言,或由自動辨識產生。如果後面要引用原話,請回原音確認;不要把字幕修順後的句子加上引號,當成講者一字不差的說法。

逐字稿與關鍵畫面合併成可回查摘要的流程
教學配圖;證據與限制以正文為準。

開始前,要怎麼整理影片來源?

先建立一份來源清單,寫清楚影片名稱、來源網址或本機檔名、時長、取得日期,以及你要解決的問題。公司會議、客戶簡報或付費課程,先確認你有權把內容交給所選服務處理。

不要為了做一段摘要,就預設所有資料都能上傳。畫面裡的姓名、信箱、客戶名稱與帳號可能比口述內容更敏感。可以先遮蔽不相關資訊,或改用獲准的處理環境;不確定權限時,先用公開或自製材料練習。

把任務縮小成一個可檢查的問題,也會讓後續比較有意義。例如「整理這場會議」很難驗收;「找出三項已決議行動,附負責人、時間碼及未確定事項」就能逐項回看。若影片根本沒說負責人,答案應保留空白,而不是自動補上最像的人。

影片:產品上線討論(教學用情境)
問題:是否已經確定正式上線日期?
資料:逐字稿、兩張示意畫面
範圍:只分析提供的片段
輸出:結論/證據時間碼/仍待確認事項

怎麼準備有時間碼的逐字稿?

有字幕就先檢查字幕,沒有字幕才考慮另外轉錄。本文不指定某個轉錄服務,也不把語音轉文字說成 Claude 一般文件上傳的既有能力。無論用哪種方法取得文字,都保留原始版本,修正另存一份。

簡單格式就夠用:每個段落前放時間碼,需要時加上說話者代號。不要只留一整篇沒有位置資訊的文字,否則當摘要提到數字或承諾時,很難找到原始片段確認。

先檢查哪些字最容易影響結論?

優先核對人名、日期、百分比、金額,以及「沒有」「尚未」「如果」這類限制詞。把「還沒有核准」漏成「已經核准」,即使其他句子都通順,結論仍會完全相反。聽不清楚時標記不確定,不用猜測填空。

時間碼則要確認是否對應同一個影片版本。剪掉片頭、加速或重新剪輯後,舊字幕的位置可能偏移。先抽查開頭、中間和結尾的幾個片段;偏移尚未修正前,不要把時間碼當成精確引用。

[00:08] 講者 A:六月的試用人數是一百二十。
[00:18] 講者 A:我們希望下週上線,但還沒核准。
[00:30] 講者 A:預算等財務確認,今天先不定案。

哪些畫面值得擷取給 Claude?

選會改變理解的畫面,不必先追求固定每隔幾秒截一次。投影片換頁、數值出現、操作前後狀態不同,都是可以優先保留的位置。截圖檔名寫上時間碼,例如 frame-00-18.png,並確認字體在正常大小下仍可讀。

如果問題是操作教學,截下「點擊前的入口」和「完成後的結果」比只有最後一張成功畫面更有用。但兩張靜態圖仍不能證明中間只做了某一步;有疑問就回影片,而不是要求模型把空白補成合理故事。

官方文件也提醒,非 PDF 文件中的內嵌圖片不會隨文字抽取被解讀。因此本文練習把圖片分別提供,不假設貼在某份文字文件裡就一定能被看到。檔案與尺寸限制會變動,實際以上傳介面和官方說明為準。

逐字稿、畫面與推論三種證據層次
教學配圖;證據與限制以正文為準。

怎麼要求 Claude 產生可回查的摘要?

先要求它列出實際讀到的資料,再請它回答問題。這能暴露少檔、讀不到圖片或只拿到部分片段的情況;不過模型說「讀到了」仍不是充分證明,後面還要用具體內容核對。

請只依我附上的逐字稿與圖片回答。
先列出可讀取的檔案;讀不到的請明說。
回答:正式上線日期是否已確定?
每項結論附:證據類型、檔名、時間碼、支持內容。
區分「講者說法」「畫面資訊」「你的推論」。
資料矛盾時並列,不自行挑一個當事實。
沒有提到的日期、負責人與金額,寫「資料未提供」。
最後列出需要回原片確認的事項。

第一次輸出不要急著修文筆。先核對來源是否真的支持結論,再縮成摘要。否則,一段更流暢的文字只是把原本的不確定藏得更好。

想比較不同輸入的效果,可以在兩個獨立對話使用同一個問題:第一組只給逐字稿,第二組給逐字稿與圖片。記錄模型名稱、日期、實際附件及完整回答,才不會把前一輪提供過的資訊誤認成只靠字幕得出的結果。

同一段內容,加入畫面後應該多知道什麼?

本篇用自製教學材料示範判讀:逐字稿在 00:18 說「希望下週上線,但還沒核准」;同一時間的示意畫面寫「內部測試版」。這兩項資訊都不能支持「下週已確定正式上線」。畫面補了版本狀態,沒有把願望變成決議。

00:18逐字稿與內部測試版畫面的證據對照
教學配圖;證據與限制以正文為準。
人工建立的核對答案,不是模型測試成績
待檢查敘述材料能否支持理由
六月有 120 位試用者可以,限教學情境00:08 逐字稿與示意圖一致
下週已確定正式上線不可以00:18 明說尚未核准
目前展示的是內部測試版需畫面才能支持00:18 示意畫面有標示
預算為 10 萬元不可以材料沒有提供任何預算金額

這個練習的用途是提供一把核對尺,不是證明某個模型準確率較高。本次沒有執行 Claude 雙組輸入測試,也沒有測試第三方影片 Skill。你實際操作後,可以把回答放進核對表,逐項記錄支持、誤讀或缺漏。

摘要完成後,怎麼檢查錯誤與遺漏?

至少回查所有會影響行動的數字、日期、決議與人名。若摘要說已通過,找到原句確認究竟是「通過」「待通過」或「假設通過」;若結論來自圖片,確認沒有讀錯表格欄位。

再問一次:有哪些重要資訊完全沒被摘要提到?只檢查已寫出的句子,找不到漏掉的反對意見或附帶條件。可以先人工列三個你知道影片有回答的問題,看看摘要是否涵蓋,並保留未分析片段的範圍。

遇到口述與畫面矛盾,例如講者說 120、圖表卻是 150,先標示衝突並回看上下文。可能是不同月份、舊投影片或口誤;沒有確認之前,不要讓模型自行判定誰比較可信。

最後保存原始逐字稿、選用畫面、提示詞、摘要與核對紀錄。下次影片版本更新,只要比較受影響片段,就不必重新猜測這段結論從哪裡來。

Claude 影片摘要常見問題

貼上 YouTube 網址就可以了嗎?

不能只因模型產生摘要就認定它讀到了影片。先要求說明取得的是網頁文字、字幕還是畫面,再用一個只有片中才有的細節核對。若讀不到,改提供有權使用的逐字稿與圖片。

沒有字幕時怎麼辦?

先使用你有權使用的轉錄方式取得文字,或縮小到一段人工整理。不要要求模型依影片標題補出內容。涉及畫面操作的問題,仍需要圖片佐證。

一定要安裝 watch video Skill 嗎?

不一定。先用少量文字與圖片把核對流程跑通,再評估是否值得自動化。安裝前確認程式來源、實際資料流、權限與費用,不因名稱相同就當成同一套工具。

附了圖片就不會出錯嗎?

仍可能看錯小字、時間關係或數值。圖片只增加可用證據,不取消人工核對。真正可用的摘要,應讓你知道它根據什麼,以及還有哪些不知道。

參考資料與示範範圍

功能資料核查:2026-09-09。Anthropic:Upload files to Claude。其餘流程與核對表為本篇原創操作設計;自製材料不是實際 Claude 使用結果,也不代表所有影片輸入均適用。