
Trascrizione YouTube: Video lunghi in pochi minuti
Trascrizione YouTube — Incolla un video, ottieni il testo
Incolla qualsiasi link YouTube — video standard, Shorts, replay di Live, podcast, lezioni o corsi completi — e ottieni una trascrizione letterale nella lingua parlata, un riepilogo nella tua lingua e un file scaricabile. Nessun menu di impostazioni, nessun compromesso sulla lingua originale e nessuna copia manuale, timestamp dopo timestamp, dal pannello di trascrizione di YouTube.
Questa Skill trasforma il parlato dei video YouTube in testo ricercabile, citabile e traducibile. Funziona con qualsiasi video pubblico di YouTube in qualsiasi lingua, supporta testo semplice, Markdown con timestamp e sottotitoli SRT, e seleziona automaticamente il formato in base a come formuli la richiesta, non da una pagina di impostazioni.
A chi è rivolta
- Ricercatori e analisti che trasformano interviste, podcast e conferenze di un’ora in testo ricercabile: leggi in 5 minuti ciò che richiederebbe 90 minuti di visione
- Studenti e persone che imparano in autonomia che salvano lezioni, tutorial e serie educative per appunti, ripasso e guide allo studio
- Giornalisti e fact-checker che citano video YouTube, dichiarazioni pubbliche, interviste registrate e discorsi politici
- Creator che riutilizzano video lunghi in Shorts, Reels, TikTok, articoli, newsletter o podcast
- Podcaster che trasformano episodi pubblicati su YouTube in note, articoli e contenuti indicizzabili dai motori di ricerca
- Marketer e ricercatori della concorrenza che analizzano canali concorrenti, video di brand, webinar commerciali e demo di prodotto
- Ingegneri, sviluppatori e studenti tecnici che vogliono rendere ricercabili conferenze, tutorial e video di code review
- Studenti di lingue che utilizzano contenuti di madrelingua con trascrizione letterale e riepilogo tradotto
- Traduttori e team di localizzazione che preparano testi sorgente per sottotitoli, doppiaggio e versioni internazionali
- Team di accessibilità e docenti che generano file SRT quando i sottotitoli automatici di YouTube non sono abbastanza precisi
- Pastori, coach e insegnanti che trascrivono sermoni, lezioni e corsi per archivi e materiali didattici
- Professionisti e dirigenti che preferiscono consultare conferenze, keynote e presentazioni dei risultati in formato ricercabile
Il problema che risolve
YouTube ospita il più grande archivio mondiale di conoscenza parlata: interviste, podcast, lezioni, conferenze, corsi, notizie, sermoni, video formativi e analisi di esperti. La piattaforma offre sottotitoli automatici e un pannello di trascrizione, ma trasformarli in testo realmente utilizzabile è più difficile del necessario:
- Il pannello non organizza il testo in pagine o paragrafi e non lo esporta in modo pulito: copiandolo si ottiene una parete di frammenti con timestamp
- I sottotitoli automatici sono incoerenti con accenti, termini tecnici, nomi propri e voci sovrapposte
- Non esiste un riepilogo integrato, neppure per video di 90 minuti
- Non esiste un semplice export SRT per ripubblicare o tradurre il contenuto
- Non è possibile cercare facilmente in più video, perché ogni trascrizione resta isolata
Gli strumenti di terze parti spesso falliscono in uno di questi tre modi:
- Traducono la trascrizione quando non dovrebbero. Volevi citare letteralmente un ospite che parla spagnolo, ma lo strumento ha restituito una parafrasi in inglese.
- Lasciano il riepilogo nella lingua originale. Non conosci il tedesco, ma il riepilogo viene restituito in tedesco.
- Nascondono tutto dietro un menu di impostazioni. Volevi solo incollare un link, ma finisci per configurare chiavi API, percorsi di output e interruttori.
Il problema comune è che questi strumenti sono ottimizzati per l’ingegnere che costruisce il workflow, non per il ricercatore, giornalista, studente o creator che vuole completare un’attività in 30 secondi.
Questa Skill riceve un link e una frase. Restituisce il risultato corretto.
Cosa la rende diversa
1. Output in due lingue per impostazione predefinita.
La trascrizione resta letterale nella lingua originale dell’audio. Ogni citazione rimane intatta, parola per parola, esattamente come è stata pronunciata. Il riepilogo e i punti chiave vengono restituiti nella lingua della conversazione. Un utente anglofono che trascrive un’intervista in spagnolo riceve una trascrizione in spagnolo e un riepilogo in inglese. Un utente che scrive in mandarino e trascrive una lezione in giapponese riceve una trascrizione in giapponese e un riepilogo in mandarino. Nessun interruttore e nessun parametro linguistico. L’output bilingue è il comportamento predefinito perché soddisfa la necessità reale: una citazione precisa in una lingua e una comprensione rapida in un’altra.
2. Il formato di output deriva dalla frase, non da un menu.
Scrivi “dammi i sottotitoli” → ricevi un file SRT pronto per Premiere, DaVinci Resolve, CapCut o YouTube Studio. Scrivi “con timestamp per trovare la parte sui prezzi” → ricevi Markdown con prefissi [MM:SS] per ogni paragrafo, citabile al secondo. Se non specifichi un formato → ricevi testo semplice e pulito, facile da leggere, riassumere e incollare in Notion, Google Docs o Obsidian. Il rilevamento delle parole chiave funziona in qualsiasi posizione e forma grammaticale in inglese, spagnolo, cinese, giapponese e coreano. “字幕”, “タイムスタンプ” e “자막” attivano lo stesso output dei termini inglesi equivalenti.
3. Veloce con contenuti lunghi, anche un podcast di tre ore.
Podcast lunghi, conferenze di due ore, lezioni universitarie complete, sessioni AMA e presentazioni dei risultati sono i contenuti in cui la trascrizione offre più valore e dove gli strumenti tradizionali diventano più lenti. Molti trascrittori AI inviano l’intero testo al modello di riepilogo prima di mostrare un risultato, aggiungendo 60–120 secondi sui video lunghi e diversi minuti sui contenuti di più ore. Questa Skill crea un estratto ausiliario con la prima e l’ultima frase di ogni paragrafo e genera il riepilogo da quello. Utilizza circa la metà dei token mantenendo una qualità comparabile. L’attesa passa da “cinque minuti per ricevere una parete di testo” a “meno di due minuti per ottenere un riepilogo chiaro e un file salvato”. La trascrizione completa viene comunque salvata.
Contenuti YouTube supportati
| Tipo di contenuto | Supportato | Note |
|---|---|---|
| Video standard | ✓ | Il caso più comune. La maggior parte viene trascritta in 30–90 secondi, in base alla durata. |
| YouTube Shorts | ✓ | Video brevi sotto i 60 secondi. Stessa gestione di TikTok e Reels. |
| Replay di Live | ✓ | Live salvate sul canale dopo la fine della trasmissione. |
| Podcast ed episodi completi | ✓ | Il caso d’uso lungo più frequente. |
| Premiere YouTube concluse | ✓ | Gestite come video standard dopo la fine della Premiere. |
| Lezioni e corsi completi | ✓ | Conferenze universitarie, corsi online e serie formative. |
| Video riservati agli abbonati | ✗ | Il link deve essere accessibile senza login o abbonamento. |
| Live in corso | ✗ | Funzionano solo le registrazioni concluse. |
| Video con limiti di età | ✗ | Se richiedono verifica dell’età, il link non restituisce contenuti. |
| Video bloccati per regione | ✗ | Se non disponibili nella regione di elaborazione, la trascrizione non riesce. |
| Video rimossi o privati | ✗ | Il video potrebbe essere stato eliminato, reso privato o non in elenco. |
Esempi
Esempio 1 — Fare ricerca da un podcast di due ore
Un ricercatore prepara un report e deve individuare i principali argomenti di un podcast di due ore con un esperto del settore.
“Cosa ha detto l’ospite sulle interruzioni della catena di approvvigionamento? https://youtu.be/abc123def”
Cosa riceve:
- Prima, la sezione sulla catena di approvvigionamento con citazioni letterali e contesto
- Un riepilogo di 2–4 frasi sull’episodio
- 3–6 punti chiave sui temi principali
- La trascrizione completa in un file scaricabile
Esempio 2 — Trasformare un lungo video YouTube in un articolo
Un creator ha pubblicato un approfondimento di 45 minuti e vuole trasformarlo in un articolo, una newsletter e una serie di clip.
“Trascrivi questo video con timestamp https://youtu.be/myvideo123”
Cosa riceve:
- Un riepilogo di 2–4 frasi sull’arco argomentativo
- 3–6 punti chiave utilizzabili come struttura dell’articolo
- La trascrizione completa in Markdown con prefissi
[MM:SS]per ogni paragrafo
Esempio 3 — Sottotitolare una conferenza per ripubblicarla
Un team tecnico vuole ripubblicare una conferenza dell’anno precedente sulla piattaforma formativa interna con sottotitoli SRT.
“Genera sottotitoli SRT per https://www.youtube.com/watch?v=xyz789”
Cosa riceve:
- Un file
.srtin formato SubRip standard con timecode corretti - Un breve riepilogo e punti chiave per descrizione e metadati
Formati di output
| Formato | Attivato da | Utilizzo |
|---|---|---|
Testo semplice (.txt) |
Predefinito, nessuna parola chiave richiesta | Leggere, riassumere, citare o incollare in Notion, Google Docs, Obsidian, articoli e newsletter |
Markdown con timestamp (.md) |
“timestamp”, “timecode”, “con i tempi”, “时间戳”, “タイムスタンプ” | Individuare momenti precisi, selezionare clip, creare appunti o riferimenti accademici |
Sottotitoli SRT (.srt) |
“sottotitoli”, “captions”, “SRT”, “字幕”, “サブタイトル”, “자막” | Ripubblicare con sottotitoli, migliorare l’accessibilità, preparare traduzioni o script di doppiaggio |
Lingue supportate
Il motore di trascrizione supporta inglese, spagnolo, portoghese, francese, tedesco, italiano, olandese, mandarino, cantonese, giapponese, coreano, vietnamita, thailandese, indonesiano, tagalog, arabo, hindi, urdu, russo, turco, polacco, ceco, ungherese e la maggior parte delle principali lingue europee, asiatiche, mediorientali e latinoamericane. Nei video multilingue, la lingua dominante viene utilizzata come base, mentre la trascrizione letterale conserva tutte le lingue così come sono state pronunciate.
Non è necessario specificare la lingua. I segnali dell’URL e del nome del canale guidano il rilevamento automatico. Se il primo tentativo non restituisce risultati, la Skill riprova una volta nella lingua della conversazione. Dopo due tentativi vuoti, ti verrà chiesto di confermare. In genere significa che il video è privato, limitato per età o regione, riservato agli abbonati oppure rimosso.
Se conosci già la lingua dell’audio, puoi indicarla nel prompt, ad esempio “questo podcast in spagnolo” o “l’audio è in giapponese”.
Accuratezza e risultati attesi
La trascrizione è letterale: viene prodotta da un sistema di riconoscimento vocale e non viene mai riscritta o parafrasata. Intercalari, ripetizioni, esitazioni e sovrapposizioni tra le voci vengono preservati. Questo è importante quando la formulazione esatta serve come prova in ambito giornalistico, accademico, legale o di fact-checking.
L’accuratezza è elevata con un singolo relatore e audio chiaro. La maggior parte dei podcast, delle lezioni e dei video ben prodotti viene trascritta con pochi errori. Conversazioni con più persone, voci sovrapposte, vocabolario molto tecnico, nomi propri rari, accenti regionali marcati, vecchie registrazioni da remoto e audio fortemente compresso possono ridurre la precisione. Per utilizzi importanti, verifica le citazioni critiche nel video originale.
La Skill elabora solo link pubblici. Non accede a contenuti privati, riservati agli abbonati o non in elenco.
Fuori ambito
- File video locali — download
.mp4, registrazioni dello schermo e file salvati sul computer devono essere elaborati con la Skill correlataaudio-to-text - Live in corso — funzionano solo le registrazioni concluse
- Video riservati agli abbonati o con limiti di età — il link deve essere accessibile senza login o verifica
- Video privati e non in elenco — la Skill non può effettuare l’accesso a YouTube al posto tuo
- Video musicali senza parlato — tracce strumentali e performance senza narrazione non contengono nulla di utile da trascrivere
- Traduzione della trascrizione stessa — la trascrizione resta nella lingua originale; richiedi la traduzione dopo aver ricevuto il testo


