Get started
Transcrição YouTube: Resuma vídeos longos rápido

Transcrição YouTube: Resuma vídeos longos rápido

Ferramenta de transcrição do YouTube para estudantes, ouvintes de podcasts em busca de citações e quem está cansado de avançar e voltar em vídeos longos. Cole um link público de tutorial, palestra, podcast, aula ou entrevista e receba uma transcrição literal com resumo por IA e pontos principais, geralmente em menos de dois minutos. Exporte em texto simples, Markdown com timestamps ou SRT. A transcrição mantém o idioma original; o resumo é traduzido para o idioma do chat.
#Vídeo#Redes sociais
Avaliação
4.0
Vendas
33
Como usar
Executar na Capafy
Também em aplicativos externos
Fornecido pelo publisher
Claude Sonnet 4.6

Transcrição do YouTube — Cole um vídeo e obtenha o texto

ytb.webp

Cole qualquer link do YouTube — vídeos comuns, Shorts, reprises de Lives, podcasts, aulas ou cursos completos — e receba uma transcrição literal no idioma falado, um resumo no seu idioma e um arquivo para download. Sem menu de configurações, sem comprometer o idioma original e sem copiar manualmente cada trecho do painel de transcrição do YouTube.

Esta Skill transforma o conteúdo falado do YouTube em texto pesquisável, citável e traduzível. Funciona com qualquer vídeo público do YouTube em qualquer idioma, oferece saída em texto simples, Markdown com timestamps ou legendas SRT e seleciona o formato automaticamente com base na forma como você escreve o pedido, não em uma página de configurações.

Para quem é

  • Pesquisadores e analistas que transformam entrevistas, podcasts e conferências longas em texto pesquisável: leia em 5 minutos o que levaria 90 minutos para assistir
  • Estudantes e aprendizes contínuos que salvam aulas, tutoriais e séries educacionais para anotações, revisão e guias de estudo
  • Jornalistas e verificadores de fatos que citam vídeos do YouTube, declarações públicas, entrevistas gravadas e discursos políticos
  • Criadores de conteúdo que transformam vídeos longos em Shorts, Reels, TikToks, artigos, newsletters ou podcasts
  • Podcasters que convertem episódios publicados no YouTube em notas, artigos e conteúdo indexável por mecanismos de busca
  • Profissionais de marketing e pesquisadores da concorrência que analisam canais concorrentes, vídeos de marca, webinars de vendas e demonstrações de produtos
  • Engenheiros, desenvolvedores e estudantes técnicos que querem pesquisar em conferências, tutoriais e vídeos de revisão de código
  • Estudantes de idiomas que utilizam conteúdo de falantes nativos com transcrição literal e resumo traduzido
  • Tradutores e equipes de localização que preparam textos de origem para legendas, dublagem e versões internacionais
  • Equipes de acessibilidade e educadores que geram arquivos SRT quando as legendas automáticas do YouTube não são precisas o suficiente
  • Pastores, coaches e professores que transcrevem sermões, palestras e cursos para arquivos e materiais didáticos
  • Profissionais e executivos que preferem consultar palestras, apresentações e chamadas de resultados em formato pesquisável

O problema que resolve

O YouTube hospeda o maior arquivo mundial de conhecimento falado: entrevistas, podcasts, aulas, conferências, cursos, notícias, sermões, treinamentos e análises de especialistas. A plataforma oferece legendas automáticas e um painel de transcrição, mas transformar isso em texto realmente utilizável é mais difícil do que deveria:

  • O painel não organiza o texto em páginas ou parágrafos e não exporta de forma limpa: copiar gera uma parede de fragmentos com timestamps
  • As legendas automáticas são inconsistentes com sotaques, vocabulário técnico, nomes próprios e falas sobrepostas
  • Não existe resumo integrado, mesmo em vídeos de 90 minutos
  • Não há uma exportação SRT simples para republicação ou tradução
  • Não é possível pesquisar facilmente em vários vídeos, pois cada transcrição fica isolada

Ferramentas de terceiros costumam falhar de uma destas três maneiras:

  • Traduzem a transcrição quando não deveriam. Você queria citar literalmente um convidado que fala espanhol, mas a ferramenta retornou uma paráfrase em inglês.
  • Mantêm o resumo no idioma de origem. Você não lê alemão, mas o resumo foi entregue em alemão.
  • Escondem tudo atrás de um menu de configurações. Você só queria colar um link, mas acaba configurando chaves de API, caminhos de saída e opções.

O problema em comum é que essas ferramentas são otimizadas para o engenheiro que constrói o fluxo de trabalho, não para o pesquisador, jornalista, estudante ou criador que deseja concluir uma tarefa em 30 segundos.

Esta Skill recebe um link e uma frase. Ela retorna o resultado certo.

O que a torna diferente

1. Saída em dois idiomas por padrão.

A transcrição permanece literal no idioma original do áudio. Cada citação fica intacta, palavra por palavra, exatamente como foi dita. O resumo e os pontos principais aparecem no idioma da sua conversa. Um usuário que escreve em inglês e transcreve uma entrevista em espanhol recebe uma transcrição em espanhol e um resumo em inglês. Um usuário que escreve em mandarim e transcreve uma aula em japonês recebe uma transcrição em japonês e um resumo em mandarim. Não há botão para alternar nem parâmetro de idioma. A saída bilíngue é o padrão porque atende à necessidade real: uma citação precisa em um idioma e compreensão rápida em outro.

2. O formato de saída vem da sua frase, não de um menu.

Escreva “gere legendas” → você recebe um arquivo SRT pronto para Premiere, DaVinci Resolve, CapCut ou YouTube Studio. Escreva “com timestamps para encontrar a parte sobre preços” → você recebe Markdown com prefixos [MM:SS] em cada parágrafo, citável até o segundo. Não especifique um formato → você recebe texto simples e limpo, fácil de ler, resumir e colar no Notion, Google Docs ou Obsidian. A detecção de palavras-chave funciona em inglês, espanhol, chinês, japonês e coreano. “字幕”, “タイムスタンプ” e “자막” acionam a mesma saída que seus equivalentes em inglês.

3. Rápida com conteúdo longo, até um podcast de três horas.

Podcasts longos, conferências de duas horas, aulas universitárias completas, sessões AMA e chamadas de resultados são os conteúdos em que a transcrição gera mais valor e em que as ferramentas tradicionais ficam mais lentas. Muitas ferramentas de IA enviam o texto completo ao modelo de resumo antes de mostrar o resultado, adicionando 60–120 segundos aos vídeos longos e vários minutos ao conteúdo de várias horas. Esta Skill cria um resumo auxiliar com a primeira e a última frase de cada parágrafo. Isso reduz aproximadamente pela metade os tokens de entrada, mantendo qualidade semelhante. A experiência muda de “esperar cinco minutos por uma parede de texto” para “receber em menos de dois minutos um resumo claro e um arquivo salvo”. A transcrição completa continua sendo salva.

Conteúdo do YouTube compatível

Tipo de conteúdo Compatível Observações
Vídeos comuns O caso mais frequente. A maioria é transcrita em 30–90 segundos, dependendo da duração.
YouTube Shorts Vídeos curtos com menos de 60 segundos. Mesmo processamento de TikTok e Reels.
Reprises de Lives Lives salvas no canal depois do término da transmissão.
Podcasts e episódios completos O uso mais comum para conteúdo longo.
Estreias do YouTube concluídas Processadas como vídeos comuns após o término da estreia.
Aulas e cursos completos Palestras universitárias, cursos online e séries de treinamento.
Vídeos exclusivos para membros O link deve estar acessível sem login ou assinatura do canal.
Lives em andamento Apenas gravações concluídas funcionam.
Vídeos com restrição de idade Se exigirem verificação de idade, o link não retorna conteúdo.
Vídeos bloqueados por região Se não estiverem disponíveis na região de processamento, a transcrição falha.
Vídeos removidos ou privados O vídeo pode ter sido excluído, tornado privado ou definido como não listado.

Exemplos

Exemplo 1 — Pesquisar em um podcast de duas horas

Um pesquisador prepara um relatório e precisa identificar os principais argumentos de um podcast de duas horas com um especialista.

“O que o convidado disse sobre a interrupção da cadeia de suprimentos? https://youtu.be/abc123def”

O que é retornado:

  • Primeiro, a seção sobre a cadeia de suprimentos com citações literais e contexto
  • Um resumo de 2–4 frases do episódio
  • 3–6 pontos principais
  • A transcrição completa salva em um arquivo para download

Exemplo 2 — Transformar um vídeo longo em artigo

Um criador publicou uma análise de 45 minutos e quer transformá-la em artigo, newsletter e clipes sociais.

“Transcreva este vídeo com timestamps https://youtu.be/myvideo123”

O que é retornado:

  • Um resumo de 2–4 frases sobre a estrutura do argumento
  • 3–6 pontos principais que podem servir como estrutura do artigo
  • A transcrição completa em Markdown com [MM:SS] em cada parágrafo

Exemplo 3 — Legendar uma palestra para republicação

Uma equipe de engenharia quer republicar uma palestra antiga em uma plataforma interna com legendas SRT.

“Gere legendas SRT para https://www.youtube.com/watch?v=xyz789”

O que é retornado:

  • Um arquivo .srt no formato padrão SubRip com timecodes corretos
  • Um resumo curto e pontos principais para descrição e metadados

Formatos de saída

Formato Ativado por Uso
Texto simples (.txt) Padrão, sem palavra-chave de formato Ler, resumir, citar ou colar no Notion, Google Docs, Obsidian, artigos e newsletters
Markdown com timestamps (.md) “timestamps”, “timecodes”, “com tempos”, “时间戳”, “タイムスタンプ” Localizar momentos exatos, selecionar clipes, criar notas ou referências acadêmicas
Legendas SRT (.srt) “legendas”, “captions”, “SRT”, “字幕”, “サブタイトル”, “자막” Republicar com legendas, melhorar a acessibilidade, preparar traduções ou roteiros de dublagem

Idiomas compatíveis

O mecanismo de transcrição aceita inglês, espanhol, português, francês, alemão, italiano, holandês, mandarim, cantonês, japonês, coreano, vietnamita, tailandês, indonésio, tagalo, árabe, hindi, urdu, russo, turco, polonês, tcheco, húngaro e a maioria dos principais idiomas europeus, asiáticos, do Oriente Médio e da América Latina. Em vídeos multilíngues, o idioma dominante é usado como base, mas a transcrição literal preserva todos os idiomas como foram falados.

Você não precisa especificar o idioma. Sinais na URL e no nome do canal ajudam na detecção automática. Se a primeira tentativa vier vazia, a Skill tenta uma vez no idioma da sua conversa. Depois de duas tentativas vazias, ela pede uma confirmação. Normalmente, o vídeo é privado, possui restrição de idade ou região, é exclusivo para membros ou foi removido.

Se você já souber o idioma do áudio, pode mencioná-lo no prompt, por exemplo “este podcast em espanhol” ou “o áudio está em japonês”.

Precisão e resultados esperados

A transcrição é literal. Ela é produzida por um sistema de reconhecimento de fala e nunca reescrita ou parafraseada. Palavras de preenchimento, repetições, hesitações e falas sobrepostas são preservadas. Isso é importante quando a formulação exata serve como evidência em jornalismo, pesquisa, contextos jurídicos ou verificação de fatos.

A precisão é alta com áudio claro de um único falante. A maioria dos podcasts, aulas e vídeos bem produzidos é transcrita com poucos erros. Conversas com várias pessoas, vozes sobrepostas, vocabulário técnico, nomes próprios raros, sotaques regionais fortes, áudio remoto antigo e som muito comprimido podem reduzir a precisão. Verifique citações importantes no vídeo original.

A Skill processa apenas links públicos. Ela não faz login no YouTube nem acessa conteúdo privado, exclusivo para membros ou não listado.

Fora do escopo

  • Arquivos de vídeo locais — downloads .mp4, gravações de tela e arquivos salvos devem ser processados com a Skill relacionada audio-to-text
  • Lives em andamento — apenas gravações concluídas funcionam
  • Vídeos exclusivos para membros ou com restrição de idade — o link deve estar acessível sem login ou verificação
  • Vídeos privados e não listados — a Skill não pode fazer login no YouTube em seu nome
  • Vídeos musicais sem conteúdo falado — faixas instrumentais e apresentações sem narração não possuem conteúdo útil para transcrever
  • Tradução da própria transcrição — a transcrição permanece no idioma de origem; peça a tradução depois de receber o texto original