
Transcrição YouTube: Resuma vídeos longos rápido
Transcrição do YouTube — Cole um vídeo e obtenha o texto
Cole qualquer link do YouTube — vídeos comuns, Shorts, reprises de Lives, podcasts, aulas ou cursos completos — e receba uma transcrição literal no idioma falado, um resumo no seu idioma e um arquivo para download. Sem menu de configurações, sem comprometer o idioma original e sem copiar manualmente cada trecho do painel de transcrição do YouTube.
Esta Skill transforma o conteúdo falado do YouTube em texto pesquisável, citável e traduzível. Funciona com qualquer vídeo público do YouTube em qualquer idioma, oferece saída em texto simples, Markdown com timestamps ou legendas SRT e seleciona o formato automaticamente com base na forma como você escreve o pedido, não em uma página de configurações.
Para quem é
- Pesquisadores e analistas que transformam entrevistas, podcasts e conferências longas em texto pesquisável: leia em 5 minutos o que levaria 90 minutos para assistir
- Estudantes e aprendizes contínuos que salvam aulas, tutoriais e séries educacionais para anotações, revisão e guias de estudo
- Jornalistas e verificadores de fatos que citam vídeos do YouTube, declarações públicas, entrevistas gravadas e discursos políticos
- Criadores de conteúdo que transformam vídeos longos em Shorts, Reels, TikToks, artigos, newsletters ou podcasts
- Podcasters que convertem episódios publicados no YouTube em notas, artigos e conteúdo indexável por mecanismos de busca
- Profissionais de marketing e pesquisadores da concorrência que analisam canais concorrentes, vídeos de marca, webinars de vendas e demonstrações de produtos
- Engenheiros, desenvolvedores e estudantes técnicos que querem pesquisar em conferências, tutoriais e vídeos de revisão de código
- Estudantes de idiomas que utilizam conteúdo de falantes nativos com transcrição literal e resumo traduzido
- Tradutores e equipes de localização que preparam textos de origem para legendas, dublagem e versões internacionais
- Equipes de acessibilidade e educadores que geram arquivos SRT quando as legendas automáticas do YouTube não são precisas o suficiente
- Pastores, coaches e professores que transcrevem sermões, palestras e cursos para arquivos e materiais didáticos
- Profissionais e executivos que preferem consultar palestras, apresentações e chamadas de resultados em formato pesquisável
O problema que resolve
O YouTube hospeda o maior arquivo mundial de conhecimento falado: entrevistas, podcasts, aulas, conferências, cursos, notícias, sermões, treinamentos e análises de especialistas. A plataforma oferece legendas automáticas e um painel de transcrição, mas transformar isso em texto realmente utilizável é mais difícil do que deveria:
- O painel não organiza o texto em páginas ou parágrafos e não exporta de forma limpa: copiar gera uma parede de fragmentos com timestamps
- As legendas automáticas são inconsistentes com sotaques, vocabulário técnico, nomes próprios e falas sobrepostas
- Não existe resumo integrado, mesmo em vídeos de 90 minutos
- Não há uma exportação SRT simples para republicação ou tradução
- Não é possível pesquisar facilmente em vários vídeos, pois cada transcrição fica isolada
Ferramentas de terceiros costumam falhar de uma destas três maneiras:
- Traduzem a transcrição quando não deveriam. Você queria citar literalmente um convidado que fala espanhol, mas a ferramenta retornou uma paráfrase em inglês.
- Mantêm o resumo no idioma de origem. Você não lê alemão, mas o resumo foi entregue em alemão.
- Escondem tudo atrás de um menu de configurações. Você só queria colar um link, mas acaba configurando chaves de API, caminhos de saída e opções.
O problema em comum é que essas ferramentas são otimizadas para o engenheiro que constrói o fluxo de trabalho, não para o pesquisador, jornalista, estudante ou criador que deseja concluir uma tarefa em 30 segundos.
Esta Skill recebe um link e uma frase. Ela retorna o resultado certo.
O que a torna diferente
1. Saída em dois idiomas por padrão.
A transcrição permanece literal no idioma original do áudio. Cada citação fica intacta, palavra por palavra, exatamente como foi dita. O resumo e os pontos principais aparecem no idioma da sua conversa. Um usuário que escreve em inglês e transcreve uma entrevista em espanhol recebe uma transcrição em espanhol e um resumo em inglês. Um usuário que escreve em mandarim e transcreve uma aula em japonês recebe uma transcrição em japonês e um resumo em mandarim. Não há botão para alternar nem parâmetro de idioma. A saída bilíngue é o padrão porque atende à necessidade real: uma citação precisa em um idioma e compreensão rápida em outro.
2. O formato de saída vem da sua frase, não de um menu.
Escreva “gere legendas” → você recebe um arquivo SRT pronto para Premiere, DaVinci Resolve, CapCut ou YouTube Studio. Escreva “com timestamps para encontrar a parte sobre preços” → você recebe Markdown com prefixos [MM:SS] em cada parágrafo, citável até o segundo. Não especifique um formato → você recebe texto simples e limpo, fácil de ler, resumir e colar no Notion, Google Docs ou Obsidian. A detecção de palavras-chave funciona em inglês, espanhol, chinês, japonês e coreano. “字幕”, “タイムスタンプ” e “자막” acionam a mesma saída que seus equivalentes em inglês.
3. Rápida com conteúdo longo, até um podcast de três horas.
Podcasts longos, conferências de duas horas, aulas universitárias completas, sessões AMA e chamadas de resultados são os conteúdos em que a transcrição gera mais valor e em que as ferramentas tradicionais ficam mais lentas. Muitas ferramentas de IA enviam o texto completo ao modelo de resumo antes de mostrar o resultado, adicionando 60–120 segundos aos vídeos longos e vários minutos ao conteúdo de várias horas. Esta Skill cria um resumo auxiliar com a primeira e a última frase de cada parágrafo. Isso reduz aproximadamente pela metade os tokens de entrada, mantendo qualidade semelhante. A experiência muda de “esperar cinco minutos por uma parede de texto” para “receber em menos de dois minutos um resumo claro e um arquivo salvo”. A transcrição completa continua sendo salva.
Conteúdo do YouTube compatível
| Tipo de conteúdo | Compatível | Observações |
|---|---|---|
| Vídeos comuns | ✓ | O caso mais frequente. A maioria é transcrita em 30–90 segundos, dependendo da duração. |
| YouTube Shorts | ✓ | Vídeos curtos com menos de 60 segundos. Mesmo processamento de TikTok e Reels. |
| Reprises de Lives | ✓ | Lives salvas no canal depois do término da transmissão. |
| Podcasts e episódios completos | ✓ | O uso mais comum para conteúdo longo. |
| Estreias do YouTube concluídas | ✓ | Processadas como vídeos comuns após o término da estreia. |
| Aulas e cursos completos | ✓ | Palestras universitárias, cursos online e séries de treinamento. |
| Vídeos exclusivos para membros | ✗ | O link deve estar acessível sem login ou assinatura do canal. |
| Lives em andamento | ✗ | Apenas gravações concluídas funcionam. |
| Vídeos com restrição de idade | ✗ | Se exigirem verificação de idade, o link não retorna conteúdo. |
| Vídeos bloqueados por região | ✗ | Se não estiverem disponíveis na região de processamento, a transcrição falha. |
| Vídeos removidos ou privados | ✗ | O vídeo pode ter sido excluído, tornado privado ou definido como não listado. |
Exemplos
Exemplo 1 — Pesquisar em um podcast de duas horas
Um pesquisador prepara um relatório e precisa identificar os principais argumentos de um podcast de duas horas com um especialista.
“O que o convidado disse sobre a interrupção da cadeia de suprimentos? https://youtu.be/abc123def”
O que é retornado:
- Primeiro, a seção sobre a cadeia de suprimentos com citações literais e contexto
- Um resumo de 2–4 frases do episódio
- 3–6 pontos principais
- A transcrição completa salva em um arquivo para download
Exemplo 2 — Transformar um vídeo longo em artigo
Um criador publicou uma análise de 45 minutos e quer transformá-la em artigo, newsletter e clipes sociais.
“Transcreva este vídeo com timestamps https://youtu.be/myvideo123”
O que é retornado:
- Um resumo de 2–4 frases sobre a estrutura do argumento
- 3–6 pontos principais que podem servir como estrutura do artigo
- A transcrição completa em Markdown com
[MM:SS]em cada parágrafo
Exemplo 3 — Legendar uma palestra para republicação
Uma equipe de engenharia quer republicar uma palestra antiga em uma plataforma interna com legendas SRT.
“Gere legendas SRT para https://www.youtube.com/watch?v=xyz789”
O que é retornado:
- Um arquivo
.srtno formato padrão SubRip com timecodes corretos - Um resumo curto e pontos principais para descrição e metadados
Formatos de saída
| Formato | Ativado por | Uso |
|---|---|---|
Texto simples (.txt) |
Padrão, sem palavra-chave de formato | Ler, resumir, citar ou colar no Notion, Google Docs, Obsidian, artigos e newsletters |
Markdown com timestamps (.md) |
“timestamps”, “timecodes”, “com tempos”, “时间戳”, “タイムスタンプ” | Localizar momentos exatos, selecionar clipes, criar notas ou referências acadêmicas |
Legendas SRT (.srt) |
“legendas”, “captions”, “SRT”, “字幕”, “サブタイトル”, “자막” | Republicar com legendas, melhorar a acessibilidade, preparar traduções ou roteiros de dublagem |
Idiomas compatíveis
O mecanismo de transcrição aceita inglês, espanhol, português, francês, alemão, italiano, holandês, mandarim, cantonês, japonês, coreano, vietnamita, tailandês, indonésio, tagalo, árabe, hindi, urdu, russo, turco, polonês, tcheco, húngaro e a maioria dos principais idiomas europeus, asiáticos, do Oriente Médio e da América Latina. Em vídeos multilíngues, o idioma dominante é usado como base, mas a transcrição literal preserva todos os idiomas como foram falados.
Você não precisa especificar o idioma. Sinais na URL e no nome do canal ajudam na detecção automática. Se a primeira tentativa vier vazia, a Skill tenta uma vez no idioma da sua conversa. Depois de duas tentativas vazias, ela pede uma confirmação. Normalmente, o vídeo é privado, possui restrição de idade ou região, é exclusivo para membros ou foi removido.
Se você já souber o idioma do áudio, pode mencioná-lo no prompt, por exemplo “este podcast em espanhol” ou “o áudio está em japonês”.
Precisão e resultados esperados
A transcrição é literal. Ela é produzida por um sistema de reconhecimento de fala e nunca reescrita ou parafraseada. Palavras de preenchimento, repetições, hesitações e falas sobrepostas são preservadas. Isso é importante quando a formulação exata serve como evidência em jornalismo, pesquisa, contextos jurídicos ou verificação de fatos.
A precisão é alta com áudio claro de um único falante. A maioria dos podcasts, aulas e vídeos bem produzidos é transcrita com poucos erros. Conversas com várias pessoas, vozes sobrepostas, vocabulário técnico, nomes próprios raros, sotaques regionais fortes, áudio remoto antigo e som muito comprimido podem reduzir a precisão. Verifique citações importantes no vídeo original.
A Skill processa apenas links públicos. Ela não faz login no YouTube nem acessa conteúdo privado, exclusivo para membros ou não listado.
Fora do escopo
- Arquivos de vídeo locais — downloads
.mp4, gravações de tela e arquivos salvos devem ser processados com a Skill relacionadaaudio-to-text - Lives em andamento — apenas gravações concluídas funcionam
- Vídeos exclusivos para membros ou com restrição de idade — o link deve estar acessível sem login ou verificação
- Vídeos privados e não listados — a Skill não pode fazer login no YouTube em seu nome
- Vídeos musicais sem conteúdo falado — faixas instrumentais e apresentações sem narração não possuem conteúdo útil para transcrever
- Tradução da própria transcrição — a transcrição permanece no idioma de origem; peça a tradução depois de receber o texto original


