開始使用
影片轉文字:TikTok、YouTube 與 Reels 逐字稿

影片轉文字:TikTok、YouTube 與 Reels 逐字稿

適用於 YouTube、TikTok、Instagram Reels、Twitter(X)等主流社群平台的影片轉文字工具。貼上任意影片連結,即可產生清晰的逐字稿、AI 摘要與重點。適合創作者、學生、行銷人員與研究人員,無須看完整支影片也能擷取引言與洞察。支援純文字、含時間戳記的 Markdown 與 SRT 字幕。逐字稿保留音訊原始語言以確保準確度,摘要則會翻譯成目前的聊天語言。
#影片#社群媒體#生產力
評分
4.3
已售出
29
使用方式
在 Capafy 上執行
也可用於外部應用程式
由創作者提供
claude-sonnet-4-6[1m]

任意社群影片 → 直接可用的多語言文字

貼上 YouTube、Instagram、X / Twitter、TikTok、Facebook、Vimeo、DailyMotion 或 Loom 連結,通常不到兩分鐘,即可取得清晰的逐字稿、AI 摘要與重點。逐字稿會保留影片中的原始口語語言,確保熱門開場、原話引用與關鍵表述準確可靠;摘要則會自動翻譯成你的聊天語言,方便立即瀏覽、分享或直接加入工作流程。

transcription.webp

功能說明

將任何公開的社群媒體影片連結轉換為可下載的逐字稿文件,包含三個部分:2–4 句的摘要、5–7 點整理主要主張、專有名詞與結論的重點,以及使用影片原始口語語言產生的完整逐字稿,並依段落排版以提升可讀性。

章節標題與摘要會自動配合你使用的語言,包括英文、簡體中文、繁體中文、日文、韓文、西班牙文、法文、德文、義大利文、葡萄牙文、荷蘭文、阿拉伯文等。逐字稿本身不會被翻譯或改寫,因此熱門開場、公開發言與平台特有表達都會保留原始措辭。

對於逐字稿不超過 2,000 個字元的短影片,例如常見的 TikTok、Reels 與 Shorts,完整內容也會直接顯示在聊天回覆中。較長的影片則只會在聊天中顯示摘要、重點與一行檔案位置提示,避免 30 分鐘的 Podcast 以大量文字塞滿整段對話。


這項 Skill 有什麼不同

多數轉錄工具只處理一個問題:將語音轉成文字。這項 Skill 涵蓋從原始影片連結到可直接使用文件的完整流程,不需要你選擇平台、設定語言或手動整理輸出內容。

逐字稿與翻譯摘要清楚分開。 逐字稿不會被改寫或翻譯。這表示熱門開場仍可準確引用,CEO 的原話會依照實際發言保留,帶字幕的影片也不會被改寫成看似接近、實際上並不精確的表述。摘要與重點則會自動使用你目前輸入的語言,不需要額外提示。多數工具要求你在原文與翻譯之間二選一,這項 Skill 會同時保留兩者,並清楚區隔。

八個平台,只需一個提示。 僅支援 YouTube 的工具很常見,但能同時處理 Instagram、TikTok、X、Facebook、Vimeo、DailyMotion 與 Loom,並自動辨識連結所屬平台的工具並不多。不需要回答「這是哪個平台」、切換外掛,也不必因為 Reels 與 Shorts 使用不同工具。

依影片長度自動調整輸出。 45 秒的 TikTok 與 40 分鐘的 Podcast 並不是同一種需求。短影片會直接在聊天中顯示完整逐字稿,方便你不用開啟檔案就能閱讀與複製。長影片則會在聊天中顯示摘要與重點,並將全文儲存為可下載檔案。長度判斷會自動完成,不需要手動設定。

一次請求,三種輸出格式。 要求時間戳記,即可取得帶有段落級 [mm:ss] 標記的 Markdown。要求字幕或 SRT,即可取得已分配時間、可直接用於影片編輯器的字幕區塊。未指定格式時,則輸出清晰的純文字。不需要切換模式,也不需要額外匯出。

內建 AI 語言偵測。 轉錄前不需要手動選擇語言。Skill 會使用 AI 辨識影片中的口語語言,並以原始語言匯出準確逐字稿。無論是英文、中文、日文、韓文、西班牙文或多語言影片,操作流程都相同:貼上連結,即可取得清晰的影片轉錄、摘要、重點與可直接使用的文件,不需要手動設定。


適用對象

  • 創作者與內容團隊:剪輯並重新發布內容、製作字幕,或為不同平台進行行銷活動在地化
  • 記者與研究人員:引用影片片段、核查熱門事件,並在不重看影片的情況下擷取準確原話
  • 學生與 Podcast 聽眾:將課程、演講、訪談與長影片轉換為可搜尋的筆記
  • 品牌、成長與 CRO 團隊:從以音訊為主的貼文或競品內容中擷取開場、觀點與洞察
  • 任何只想取得文字、不想重看影片的人:例如背景音樂過大的 TikTok、較長的 YouTube 教學、嵌入式 X 影片、資訊密集的 Reels 或複雜課程

使用方式

  1. 貼上任何公開連結。 支援 Reels、IGTV、動態貼文、Shorts、包含地區版本的 TikTok 影片、Facebook Watch、直播回放、粉絲專頁貼文、X 熱門影片、新聞片段、嵌入式影片、Vimeo、DailyMotion 與 Loom 錄製內容。Skill 會自動辨識平台與來源語言。
  2. 預設格式不合適時,說明你需要的格式。 輸入*「附時間戳記」,會回傳帶有段落級 [mm:ss] 標記的 Markdown;輸入「字幕」或「SRT」*,會回傳可直接用於影片編輯器的字幕檔案;其他情況預設回傳清晰的純文字。
  3. 取得逐字稿文件。 摘要與重點會使用你的語言直接顯示在聊天中;完整逐字稿則會以影片原始口語語言儲存為可下載檔案。短影片的完整逐字稿也會直接顯示在聊天中。

輸出格式

  • 純文字(.txt) — 不含時間標記的清晰文字。適合直接閱讀、摘要或輸入其他工具,是預設格式。
  • 附時間戳記的 Markdown(.md) — 每個段落附有 [mm:ss] 標記。適合尋找特定引用或回到影片中的對應位置。
  • SRT 字幕(.srt) — 依句子產生的時間字幕區塊,可直接用於重新發布或影片編輯。時間會自動分配,確保連續字幕不會重疊,也不會出現零時長。

語言處理

逐字稿會使用影片中實際說出的語言逐字保留,確保熱門開場、公開發言與平台特有表達在重新引用、事實核查或重新發布時仍然準確。摘要、重點與章節標題則會使用你的聊天語言。例如,以中文向 Skill 提問,即可取得英文影片的中文摘要;以日文提問,即可取得韓文影片的日文摘要。

在可能的情況下,系統會根據 URL 中的訊號自動辨識來源語言。Bilibili、Douyin、Niconico、Naver、AfreecaTV 等以單一語言為主的平台,會直接使用其主要語言。多語言平台上使用非拉丁字元的帳號名稱,也會配對至相應語言。當訊號不明確時,Skill 會預設使用該平台的主要語言;如果第一次結果為空,則會自動使用你的聊天語言靜默重試一次。


範例

輸入:

「轉錄這支影片,並告訴我關鍵結論:https://www.youtube.com/watch?v=...」

聊天中的輸出:

  • 摘要 — 使用使用者的聊天語言,透過 2–4 句說明影片內容。
  • 重點 — 5–7 點主要主張、專有名詞與結論。
  • 檔案提示 — 完整逐字稿已儲存至 transcript_<slug>.txt,並依使用者語言在地化。

可下載檔案中的輸出:中繼資料標題、相同的摘要與重點,以及使用影片原始口語語言產生的完整逐字稿,並依段落整理。

如果使用者提出具體問題,例如*「他們對定價說了什麼?」*,回覆頂部會先顯示一段簡短的原話引用,接著才顯示摘要。


輸入格式

  • 支援的平台:YouTube、Instagram,包括 Reels 與動態貼文;X / Twitter;TikTok,包括地區版本;Facebook,包括 Watch、直播回放、Reels 與粉絲專頁貼文;Vimeo、DailyMotion 與 Loom
  • 僅支援公開連結 — 無法存取私人貼文、受地區限制的內容、需要登入的頁面或直播內容
  • 支援任何口語語言 — 自動偵測;如果結果為空,會在要求使用者提供進一步說明前靜默重試一次
  • 輸出語言 — 跟隨你的聊天語言;逐字稿正文始終保留來源口語語言,不會被翻譯
  • 不支援的內容:電腦中的本機檔案,請使用獨立的音訊轉文字 Skill;文章或無音訊網頁;直播;對逐字稿正文進行翻譯