Empezar
Video a texto: TikTok, YouTube y Reels

Video a texto: TikTok, YouTube y Reels

Herramienta de transcripción de video para YouTube, TikTok, Instagram Reels, Twitter (X) y otras grandes plataformas sociales. Convierte cualquier enlace de video en una transcripción limpia con resumen por IA y puntos clave. Ideal para creadores, estudiantes, marketers e investigadores. Exporta texto simple, Markdown con marcas de tiempo o subtítulos SRT. La transcripción conserva el idioma original del audio y el resumen se traduce al idioma del chat.
#Vídeo#Redes sociales#Productividad
Valoración
4.3
Vendidos
29
Cómo se usa
Ejecutar en Capafy
También en aplicaciones externas
Proporcionado por el publisher
claude-sonnet-4-6[1m]

Cualquier video social → Texto listo para usar, en tu idioma

Pega un enlace de YouTube, Instagram, X / Twitter, TikTok, Facebook, Vimeo, DailyMotion o Loom y obtén una transcripción literal y limpia, con resumen por IA y puntos clave, normalmente en menos de dos minutos. La transcripción conserva el idioma hablado para que los ganchos y las citas mantengan su sentido exacto; el resumen se traduce automáticamente al idioma del chat para que puedas revisarlo, compartirlo o incorporarlo de inmediato a tu flujo de trabajo.

transcription.webp

Qué hace

Convierte cualquier enlace público de un video de redes sociales en un documento de transcripción descargable con tres secciones: un Resumen de 2 a 4 frases, Puntos clave con 5 a 7 viñetas que recogen las afirmaciones relevantes, entidades mencionadas y conclusiones, y la Transcripción completa en el idioma hablado, dividida en párrafos para facilitar la lectura.

Los encabezados y el resumen se adaptan automáticamente al idioma en el que escribes: inglés, chino simplificado y tradicional, japonés, coreano, español, francés, alemán, italiano, portugués, neerlandés, árabe y más. La transcripción nunca se traduce ni se reescribe, por lo que los ganchos virales, las citas textuales y las expresiones propias de cada plataforma conservan su redacción exacta.

En clips cortos, con una transcripción de hasta 2000 caracteres, como suele ocurrir en TikTok, Reels y Shorts, el texto completo también aparece directamente en la respuesta del chat. En videos más largos, se muestran el Resumen y los Puntos clave junto con una línea que indica dónde encontrar el archivo, evitando que un podcast de 30 minutos llene la conversación con un bloque enorme de texto.


Qué diferencia a esta skill

La mayoría de las herramientas de transcripción resuelven un único problema: convertir voz en texto. Esta skill cubre todo el flujo de trabajo, desde el enlace original hasta un documento listo para usar, sin pedirte que elijas la plataforma, configures el idioma o limpies manualmente el resultado.

Transcripción literal y resumen traducido, siempre separados. La transcripción nunca se reescribe ni se traduce. Así, un gancho viral sigue siendo citable, las palabras exactas de un CEO se mantienen fieles y un clip subtitulado no termina convertido en una paráfrasis que solo parece correcta. El resumen y los puntos clave sí se entregan en el idioma en el que escribes, sin necesidad de indicarlo en otro prompt. La mayoría de las herramientas te obligan a elegir entre el original o una traducción. Esta conserva ambos y los separa claramente.

Ocho plataformas, un solo prompt. Las herramientas exclusivas para YouTube son habituales. No lo son tanto las que también admiten Instagram, TikTok, X, Facebook, Vimeo, DailyMotion y Loom, y además detectan automáticamente qué plataforma has pegado. No hay preguntas adicionales sobre la plataforma, cambios de plugin ni necesidad de usar una herramienta distinta para Reels y Shorts.

Un resultado adaptado a la duración del video. Un TikTok de 45 segundos y un podcast de 40 minutos no plantean el mismo problema. En clips cortos, la transcripción completa aparece en el chat para que puedas leerla y copiarla sin abrir un archivo. En videos largos, se muestran el Resumen y los Puntos clave en el chat y se guarda el texto completo en un archivo descargable. El umbral se aplica automáticamente y no requiere configuración.

Tres formatos con una sola solicitud. Pide marcas de tiempo y recibirás Markdown con indicadores [mm:ss] por párrafo. Pide subtítulos o SRT y obtendrás bloques de subtítulos con tiempos distribuidos, listos para un editor de video. Si no indicas nada, recibirás texto limpio. No hace falta cambiar de modo ni realizar una exportación aparte.

Detección de idioma mediante IA integrada. No necesitas seleccionar un idioma antes de transcribir. La skill utiliza IA para identificar el idioma hablado en el video y exportar una transcripción precisa en el idioma original. Inglés, chino, japonés, coreano, español o clips multilingües: el proceso siempre es el mismo. Pega el enlace y obtén la transcripción, el resumen, los puntos clave y un documento listo para usar sin configuración manual.


Para quién es

  • Creadores y equipos de contenido que recortan contenido para volver a publicarlo, crean subtítulos o localizan campañas entre plataformas
  • Periodistas e investigadores que citan clips, verifican momentos virales y extraen palabras exactas sin volver a ver el video
  • Estudiantes y oyentes de podcasts que convierten clases, charlas, entrevistas y videos largos en notas consultables
  • Equipos de marca, crecimiento y CRO que extraen ganchos e insights de publicaciones centradas en audio o contenido de competidores
  • Cualquier persona que quiera las palabras sin volver a ver el video: TikToks con música alta, tutoriales largos de YouTube, clips incrustados de X, Reels cargados de información o clases densas

Cómo funciona

  1. Pega cualquier enlace público. Reels, IGTV, publicaciones del feed, Shorts, videos de TikTok, incluidas variantes regionales, Facebook Watch, repeticiones de directos, publicaciones de páginas, clips virales de X, noticias, videos incrustados, Vimeo, DailyMotion y grabaciones de Loom. La skill detecta automáticamente la plataforma y el idioma de origen.
  2. Indica qué necesitas cuando el formato predeterminado no sea el adecuado. “Con marcas de tiempo” devuelve Markdown con indicadores [mm:ss] por párrafo. “Subtítulos” o “SRT” devuelve un archivo preparado para editores de video. Cualquier otra solicitud devuelve texto limpio.
  3. Recibe un documento de transcripción. El Resumen y los Puntos clave aparecen en el chat en tu idioma. La Transcripción completa se guarda en un archivo descargable en el idioma hablado. En videos cortos, la transcripción también aparece completa en el chat.

Formatos de salida

  • Texto sin formato (.txt) — texto limpio sin marcas de tiempo. Es la opción predeterminada para leer, resumir o enviar el contenido a otra herramienta.
  • Markdown con marcas de tiempo (.md) — indicadores [mm:ss] por párrafo. Ideal para encontrar una cita concreta o volver al momento exacto del video.
  • Subtítulos SRT (.srt) — bloques temporizados por frase, listos para volver a publicarse, con tiempos distribuidos para que las líneas consecutivas no se solapen ni tengan duración cero.

Gestión de idiomas

La transcripción se mantiene literal y en el idioma hablado, de modo que los ganchos virales, las citas textuales y las expresiones propias de cada plataforma sigan siendo exactos al volver a citarlos, verificarlos o reutilizarlos. El Resumen, los Puntos clave y los encabezados aparecen en el idioma del chat. Escribe en chino para recibir un resumen en chino de un video en inglés, o escribe en japonés para recibir un resumen en japonés de un clip en coreano.

El idioma de origen se detecta automáticamente mediante señales de la URL cuando es posible. Bilibili, Douyin, Niconico, Naver, AfreecaTV y otros dominios principalmente monolingües se asignan a su idioma nativo. Los nombres de usuario escritos con alfabetos no latinos en plataformas multilingües se asocian al idioma correspondiente. Cuando las señales son ambiguas, la skill usa el idioma dominante de la plataforma y realiza silenciosamente un segundo intento en el idioma del chat si el primer resultado está vacío.


Ejemplo

Entrada:

“Transcribe esto y dame las conclusiones principales: https://www.youtube.com/watch?v=...”

Salida en el chat:

  • Resumen — de 2 a 4 frases en el idioma del chat que explican de qué trata el video.
  • Puntos clave — de 5 a 7 viñetas con las afirmaciones relevantes, entidades mencionadas y conclusiones.
  • Referencia al archivoTranscripción completa guardada en transcript_<slug>.txt, adaptado al idioma del usuario.

Salida en el archivo descargable: encabezado con metadatos, el mismo Resumen y los mismos Puntos clave, y la Transcripción literal completa en el idioma hablado, dividida en párrafos.

Si el usuario añade una pregunta concreta, como “¿Qué dijeron sobre los precios?”, la respuesta aparece como una cita literal breve al principio, antes de la sección de Resumen.


Formatos de entrada

  • Plataformas compatibles: YouTube, Instagram —Reels y publicaciones del feed—, X / Twitter, TikTok y sus variantes regionales, Facebook —Watch, repeticiones de directos, Reels y publicaciones de páginas—, Vimeo, DailyMotion y Loom
  • Solo enlaces públicos — no se puede acceder a publicaciones privadas, contenido bloqueado por región, páginas que requieren inicio de sesión ni transmisiones en directo
  • Cualquier idioma hablado — se detecta automáticamente y se realiza un único reintento silencioso si el resultado está vacío antes de pedir indicaciones
  • Idioma de salida — sigue el idioma del chat; la transcripción conserva el idioma hablado original y nunca se traduce
  • Fuera de alcance: archivos locales del ordenador, para los que debe utilizarse una skill independiente de audio a texto; artículos o páginas web sin audio; transmisiones en directo; traducción de la propia transcripción