
X(Twitter)動画文字起こし:投稿URLをテキスト化
Twitter(X)文字起こし — 動画を貼り付けて、話された内容をテキスト化
Twitter(X)の動画リンクを貼り付けるだけで、動画投稿、動画付き返信、長時間動画を問わず、音声の言語を維持した逐語文字起こし、あなたの言語での要約、ダウンロード可能なファイルを取得できます。設定メニューも、言語上の妥協も必要ありません。
このスキルは、Twitter(X)動画内の音声を、検索・引用・参照できるテキストへ変換します。あらゆる言語の公開Twitter(X)動画に対応し、プレーンテキスト、タイムスタンプ付きMarkdown、SRT字幕として出力できます。形式は設定画面で選ぶのではなく、依頼文の書き方から自動的に判定されます。
対象ユーザー
- ジャーナリストや政治記者:Twitter(X)の動画、公式発言、バイラルクリップを正確に引用したい人向けです。現在では、ニュースや公人の発言が最初に出る場所の一つがTwitter(X)です。文字起こしは書き換えられず、発言どおりに記録されるため、引用する言葉と実際に話された言葉が一致します。
- ファクトチェッカー:誤った引用を含むスクリーンショットがさらに拡散する前に、バイラル動画で実際に何が語られたのか確認できます。
- 研究者やアナリスト:長時間のTwitter(X)動画を、1時間ずっと2倍速で聞くことなく、検索・引用可能なテキストへ変換できます。
- テクノロジー企業やスタートアップのチーム:製品発表やベンチャーキャピタル関連のインタビューを文字起こしできます。テクノロジー業界の多くの知見が、現在ではTwitter(X)の動画として共有されています。
- マーケターや競合調査担当者:競合企業の創業者、ブランド動画、バイラルマーケティング動画を分析できます。50本の動画を最初から最後まで見ることなく、話された要点を読めます。
- コンテンツクリエイターやスレッド作成者:自分の動画投稿やバイラルクリップを、ブログ記事、ニュースレター、スレッド、LinkedIn投稿へ再利用できます。動画内で話した内容を数秒でテキスト化できます。
- 政策アナリストや政治ウォッチャー:政治家、活動家、公人の発言を記録できます。Twitter(X)は政治的発言の主要な場になりつつあり、その逐語文字起こしは重要な記録になります。
- 学術研究者:ソーシャルメディア上の言説、政治コミュニケーション、オンラインコミュニティ、公人のレトリックを研究できます。出力テキストはNVivo、Atlas.tiなどの質的分析ツールに取り込めます。
- 翻訳者やローカライゼーションチーム:英語動画を、他言語へ翻訳するための原文資料としてテキスト化できます。
- アクセシビリティ担当者や支援チーム:動画を別のプラットフォームへ再投稿する際、聴覚障害のある視聴者向けにSRT字幕ファイルを生成できます。
- バイラル動画で実際に何が語られたのか知りたいすべての人:スクリーンショットでも、引用投稿内の誤った引用でも、AIが言い換えたスレッドでもなく、実際に話された言葉を確認できます。
解決する課題
Twitter(X)は、政治声明、創業者による発表、速報、バイラル動画など、公の発言が最初に公開される主要な場の一つになっています。しかし、動画内の発言を実用的なテキストとして取り出すための機能はほとんどありません。
- 動画投稿にネイティブの文字起こし表示がない:リアルタイムで動画を見るか、内容を把握できないまま終わるかのどちらかです。
- 多くの動画投稿に字幕がない:プラットフォームの自動字幕は精度や提供状況が安定せず、書き出すこともできません。
- バイラル動画はスクリーンショットや引用投稿で誤って引用されやすい:確認するには、元動画を探して自分で聞くしかありません。
外部の文字起こしツールもありますが、多くは次のいずれかの問題を抱えています。
- 翻訳すべきでない文字起こしまで翻訳してしまう。 スペイン語を話す創業者の言葉をそのまま引用したかったのに、英語の言い換えが返ってきます。元の引用は失われ、ジャーナリズム、研究、ファクトチェックでは言い換えを直接引用として使えません。
- 要約が元の言語のままになる。 日本語を読めないのに、要約も日本語で返ってきます。その結果、要約を翻訳するために別のツールが必要になります。
- すべてが設定メニューの中に隠されている。 本当はリンクを貼って一文入力するだけで済ませたいのに、APIキー、出力先、各種オプションを設定しなければなりません。
共通する問題は、こうしたツールが、締め切りに追われる記者、言説を追う研究者、発言内容を検証するアナリストではなく、ワークフローを構築するエンジニア向けに最適化されていることです。
このスキルに必要なのは、リンクと一文だけです。そこから必要な結果を返します。
他との違い
1. デフォルトで2言語出力。
文字起こしは、音声の元言語を維持したまま逐語的に出力されます。引用したい言葉は、話者が実際に発したとおり、語句単位で保持されます。一方、要約と要点は、あなたが会話で使用している言語で返されます。
英語を話す記者がスペイン語を話す創業者の動画を文字起こしした場合、スペイン語の文字起こしと英語の要約を受け取ります。中国語を話す研究者が日本の政治家の動画を文字起こしした場合、日本語の文字起こしと中国語の要約を受け取ります。
切り替える設定も、覚えておく言語パラメーターもありません。正確な引用は元言語で、すばやく理解するための要約は自分の言語で必要になるからこそ、2言語出力が標準になっています。
2. メニューではなく、依頼文から出力形式を判断。
「字幕を作って」 と書けば、Premiere、DaVinci Resolve、CapCut、YouTube Studioへそのまま読み込めるSRTファイルが返されます。
「引用箇所を見つけられるようにタイムスタンプを付けて」 と書けば、各段落の先頭に [MM:SS] が付いたMarkdownが返され、発言を秒単位で確認できます。
形式を指定しなければ、読みやすく、要約や記事、スレッド、研究メモへ貼り付けやすいプレーンテキストが返されます。
キーワードは文中のどこにあっても認識され、英語、スペイン語、中国語、日本語、韓国語のさまざまな表現に対応します。「字幕」、「タイムスタンプ」、「자막」 なども、それぞれの英語表現と同じ出力処理を実行します。
設定画面も形式選択のドロップダウンもありません。普段どおりに書く一文そのものがインターフェースです。
3. 長時間動画に対応。
Twitter(X)では、有料アカウントが長時間動画を投稿できます。インタビュー、パネルディスカッション、録画された講演、創業者との質疑応答など、30分から数時間に及ぶコンテンツもあります。
多くのAI文字起こしツールは、要約を作る前に全文を要約モデルへ送ります。そのため、動画が長いほど、結果が表示されるまでにさらに数分かかります。
このスキルでは、各段落の最初と最後の文を抽出した補助ダイジェストを作成し、それをもとに要約します。入力トークンをおよそ半分に抑えながら、同等の要約品質を維持できます。長時間コンテンツでは、「5分待って大量のテキストが届く」 状態から、「2分未満で整理された要約と保存済みファイルを受け取る」 体験へ変わります。
完全な逐語文字起こしは、省略されることなく全文保存されます。ダイジェストは内部的な最適化であり、ユーザーが意識する必要はありません。複数話者の処理も、パネルディスカッションやインタビュー向けに調整されています。
対応するTwitter(X)コンテンツ
| コンテンツの種類 | 対応 | 備考 |
|---|---|---|
| 動画投稿 | ✓ | 最も一般的なケースです。多くの短い動画は15~60秒で文字起こしされます。 |
| 長時間動画 | ✓ | Twitter(X)の有料アカウントが投稿する長時間動画も、通常の動画と同じように処理されます。 |
| 動画付き返信 | ✓ | 親投稿ではなく、指定された返信に添付された動画を処理します。 |
| 動画付き引用投稿 | ✓ | 引用投稿自体に含まれる動画を処理します。元投稿のメディアは別扱いです。 |
| ライブ配信のアーカイブ | ✓ | 配信終了後にプロフィールへ保存されたライブ動画に対応します。 |
| 配信中のライブ | ✗ | 終了済みの録画のみ対応します。配信が終了するまで待ってください。 |
| 非公開アカウント | ✗ | ログインせずにアクセスできるリンクが必要です。非公開アカウントにはアクセスできません。 |
| 削除済み投稿や削除された動画 | ✗ | リンクから何も取得できない場合、投稿者が削除したか、プラットフォームによって削除された可能性があります。 |
| サブスクライバー限定動画 | ✗ | X Premiumなどの有料会員限定コンテンツには認証が必要です。 |
使用例
例1 — 公人が実際に何を発言したのか確認する
記者がフィードでバイラル動画を見つけましたが、拡散されているスクリーンショットには異なる言い換えが掲載されています。記事を公開する前に、正確な発言を確認する必要があります。
「冒頭で話者は何と言っていますか? https://x.com/username/status/1234567890」
返される内容:
- 動画冒頭で話された逐語テキストと、正確に引用するための前後の文脈。
- 動画全体をまとめた2~4文の要約。
- 内容の中心をまとめた3~6個の要点。
- 行単位で引用できる、保存済みの完全な逐語文字起こしファイル。
例2 — 創業者の長時間インタビューをアーカイブする
コミュニティマネージャーが、Twitter(X)に長時間動画として投稿された90分の創業者インタビューを保存し、ライブで見られなかったチームメンバーへ共有したいと考えています。
「この動画をタイムスタンプ付きで文字起こししてください https://x.com/username/status/1234567890」
返される内容:
- 主要なテーマをまとめた2~4文の要約。
- よく議論された質問と回答を中心にまとめた3~6個の要点。
- 各段落に
[MM:SS]が付いた完全なMarkdown文字起こし。NotionやSlackのアーカイブへそのまま貼り付けられます。 - 長時間動画でも、ダイジェスト最適化により待ち時間を2分未満に抑えます。
例3 — バイラル動画を他のプラットフォームへ投稿するために字幕を付ける
クリエイターがTwitter(X)へ投稿した90秒の動画が注目を集め始め、Instagram ReelsやYouTube Shortsへ正確な字幕付きで再投稿したいと考えています。
「https://x.com/myhandle/status/9876543210 のSRT字幕を作って」
返される内容:
- 正しいタイムコードを含む標準SubRip形式の
.srtファイル。Reelsの字幕エディター、YouTube Studio、CapCutへそのまま読み込めます。 - 再投稿先でキャプションとして使える短い要約と要点。
出力形式
| 形式 | トリガー | 用途 |
|---|---|---|
プレーンテキスト(.txt) |
デフォルト。形式を指定するキーワードは不要 | 閲覧、要約、引用、記事、研究メモ、スレッド、ニュースレターへの貼り付け |
タイムスタンプ付きMarkdown(.md) |
「タイムスタンプ」「タイムコード」「時刻付き」「时间戳」「timestamps」 | 正確な箇所の特定、切り抜き位置の確認、報道・研究での引用 |
SRT字幕(.srt) |
「字幕」「サブタイトル」「SRT」「captions」「자막」 | Reels、Shorts、TikTok、LinkedInへの字幕付き再投稿、アクセシビリティ対応、翻訳用原稿 |
対応言語
文字起こしエンジンは、英語、スペイン語、ポルトガル語、フランス語、ドイツ語、イタリア語、中国語(標準語)、広東語、日本語、韓国語、ベトナム語、タイ語、インドネシア語、アラビア語、ヘブライ語、ヒンディー語、ウルドゥー語、ロシア語、トルコ語、ポーランド語、および主要なヨーロッパ、アジア、中東、ラテンアメリカの言語に対応しています。政治やテクノロジー分野における、Twitter(X)の主要な非英語圏ユーザーの言語も含まれます。
英語とスペイン語を切り替えながら話す動画、多言語話者が参加するパネルディスカッション、海外ゲストへのインタビューなど、複数言語を含む動画も処理できます。最も多く使用されている言語を基準にしながら、逐語文字起こしでは実際に話された各言語をそのまま残します。
言語を指定する必要はありません。URLやアカウント名の情報を利用して、自動的に判定します。最初の処理結果が空だった場合は、会話で使用している言語を使って一度だけ再試行します。2回とも結果が空の場合は、確認を求めます。多くの場合、言語判定の失敗ではなく、動画が非公開、削除済み、またはPremium限定であることが原因です。
音声の言語が分かっている場合は、「この動画はスペイン語です」、「音声は日本語です」 のように依頼文へ含めることで、言語判定を省略し、数秒短縮できます。
精度と注意点
文字起こしは逐語的です。音声認識処理によって生成され、内容が書き換えられたり、言い換えられたりすることはありません。フィラー、言い直し、ためらい、重なった発言も、話されたとおりに残ります。
正確な表現そのものが重要になるジャーナリズム、ファクトチェック、研究、政治分析では、この点が特に重要です。言い換えは直接的な証拠として使用できず、誤った引用のスクリーンショットは、その後の訂正よりも広く拡散することがあります。
対応言語で、音声が明瞭かつ単独話者の場合、高い精度が期待できます。多くの動画投稿は、ほとんど誤りなく文字起こしされます。
ただし、次のような場合は精度が低下する可能性があります。
- 複数の話者が同時に話したり、互いに遮ったりする動画。
- 会話の重なりやBGMを含む動画。
- 複数の出演者が同時に発言する討論。
- 非常に専門的な用語や、認識されにくい固有名詞。
- 強い地域アクセント。
- 通信状態が悪いリモート音声。
- 強く圧縮された低品質音声。
元の音声自体が聞き取れない場合、AIだけで完全に修復することはできません。文字起こしの一部が崩れている場合、多くはモデルの不具合ではなく、元音声が聞き取りにくいことを示しています。
報道、ファクトチェック、学術研究、法的用途など、引用の正確性が特に重要な場合は、重要な箇所を元動画と照合してください。
このスキルが処理するのは公開リンクのみです。Twitter(X)へログインしたり、非公開アカウントやサブスクライバー限定コンテンツへアクセスしたりすることはありません。
対象外
- ローカル動画ファイル:Twitter(X)からダウンロードした
.mp4、画面録画、PC内に保存した動画には、関連スキルのaudio-to-textを使用してください。 - 配信中のライブ動画:終了済みの録画のみ対応します。ライブ配信中は、終了してアーカイブが公開されるまで結果が空になります。
- 非公開アカウント:リンクは一般公開されている必要があります。ユーザーに代わって認証することはできません。
- サブスクライバー限定またはPremium限定動画:X Premiumなどの有料会員限定コンテンツには認証が必要です。
- 削除済み投稿や削除された動画:リンクが空の結果を返す場合、投稿者またはプラットフォームによって削除されている可能性があります。削除済みコンテンツを復元することはできません。
- 文字起こし自体の翻訳:正確な引用を維持するため、文字起こしは意図的に元言語のまま出力されます。翻訳が必要な場合は、逐語文字起こしを受け取った後で追加の依頼として指定してください。
外部API
api.proactor.ai
