AI Gratuita Trascrizione Audio & Video
Lo strumento gratuito di trascrizione di SnipSound trasforma audio o video in testo in 99 lingue, direttamente nel tuo browser — trasforma una registrazione vocale, un podcast, un'intervista o un memo vocale in testo (trascrivi audio in testo, da voce a testo, converti audio in testo, da suono a testo). Inizia timestamp a livello di parola con evidenziazione stile karaoke, crea un video sottotitolato, metti un bip su qualsiasi parola ed esporta in .txt, .srt o .vtt. I file non lasciano mai il tuo dispositivo. Nessuna registrazione.
Trascina un file audio o video
o clicca per sfogliare.
Non hai un file? Registrane uno con il nostro registratore vocale per testare come funziona la trascrizione.
100% nel tuo browser. L'audio rimane sul tuo dispositivo. Il modello AI Whisper viene scaricato una sola volta (~75 MB) dai nostri server, poi funziona localmente per ogni trascrizione. Non possiamo accedere al tuo audio perché non lascia mai il tuo computer. Informativa sulla privacy.
Transcript
Quanto tempo ci vorrà per trascrivere il tuo file?
Gratuito: funziona al 100% nel tuo browser — privato, a costo zero, ideale per la maggior parte dei file. Per file lunghi o massima precisione, Pro funziona su GPU cloud in pochi secondi.
Qual è il trucco del gratuito?
Non c'è nessun trucco nascosto: è davvero gratuito, illimitato e privato, perché funziona su il tuo dispositivo invece che sui nostri server, quindi non abbiamo nulla da farti pagare. L'unico compromesso è time: il tuo computer non è veloce come una GPU cloud, quindi la trascrizione richiede qualche minuto. Per i clip brevi è quasi impercettibile. Per i file lunghi l'attesa si fa sentire — ed è l'unico caso in cui Pro ripaga l'investimento: lo stesso lavoro su GPU cloud in pochi secondi, con maggiore precisione, su qualsiasi dispositivo.
Gratuito vs Pro — tempi di trascrizione tipici
| Lunghezza file | Gratuito — nel tuo browser* | Pro — su cloud |
|---|---|---|
| 10 min | Circa 2–3 min | ~22 sec |
| 30 min | Circa 7–8 min | ~45 sec |
| 1 hour | ~15 min | ~1,5 min |
| 2 hours | diviso prima in parti da ≤60 minuti | ~2,5 min |
*Free times on a typical laptop with a WebGPU browser (Chrome/Edge); older devices without a GPU can be 2–4× slower. Free is capped at 60 minutes per file. Pro runs on cloud GPUs at the same speed on any device, using the larger large-v3 model for higher accuracy.
Cosa rende più veloce la trascrizione gratuita?
- Usa un browser con WebGPU — Chrome o Edge (e l'ultima versione di Firefox) lo eseguono sulla tua GPU, circa 2× più veloce rispetto a un browser solo CPU. Brave disabilita WebGPU per impostazione predefinita.
- Tieni il portatile collegato alla corrente — la modalità risparmio energetico limita CPU/GPU e può quasi raddoppiare il tempo.
- Chiudi altre schede e app pesanti — la trascrizione usa CPU/GPU e memoria; liberale.
- Un dispositivo con GPU è molto più veloce — un telefono o portatile recente con WebGPU supera di gran lunga una vecchia macchina solo CPU (un telefono moderno può persino superare un portatile senza GPU).
- La prima esecuzione scarica il modello una volta — un'attesa una tantum; ogni trascrizione successiva la salta.
Velocità per dispositivo & browser — un file di 16 minuti
| La tua configurazione | Tempo per trascrivere (16 min) |
|---|---|
| Portatile o telefono con WebGPU (Chrome, Edge, ultimo Firefox) | ~4 min |
| Telefono, solo CPU (senza WebGPU) | Circa 5–6 min |
| Laptop senza WebGPU (Brave predefinito, browser più vecchio) | ~8 min |
| Vecchio portatile, fallback a singolo core | fino a ~18 min |
| Qualsiasi dispositivo con Pro (GPU cloud) | ~29 sec |
Measured on our own benchmarks with the Whisper base model in-browser (large-v3-turbo for Pro). Your exact time varies with your device's chip and the audio itself.
Trascrizione audio & video AI gratuita e privata — come funziona
Lo strumento di trascrizione di SnipSound utilizza il modello open-source di OpenAI Whisper di riconoscimento vocale che gira interamente nel tuo browser tramite WebAssembly. Trascina l'audio or video — per i video estraiamo automaticamente la traccia audio. La prima volta che clicchi Transcribe, il tuo browser scarica un file modello di circa 75 MB dai nostri server; dopodiché, ogni trascrizione è completamente locale. Il tuo file non viene mai caricato su nessun server — né il nostro, né quello di OpenAI, né quello di nessun altro.
Lavori con i video? Prova Video a Testo. Ti serve solo un file di sottotitoli? Il Generatore SRT esporta file .srt/.vtt pronti all'uso.
A cosa serve
- Trascrivere interviste di podcast, registrazioni di riunioni, memo vocali, lezioni o qualsiasi audio con parlato chiaro.
- Aggiungere sottotitoli a un video — genera sottotitoli automatici scaricabili come .srt e .vtt con timestamp precisi che puoi usare su YouTube, Vimeo o qualsiasi editor.
- Un'alternativa gratuita e privata a Otter, Rev e Descript per giornalisti, ricercatori, studenti e creator — nessun abbonamento, nessun caricamento, nessun limite di tempo per file.
- Audio sensibile alla privacy che non vuoi su un server di terze parti — note di terapia, interviste confidenziali, riunioni interne.
- Timestamp a livello di parola — evidenziazione delle parole in stile karaoke e navigazione con un clic, per estrarre citazioni esatte o creare sottotitoli precisi.
- Trasforma l'audio in un video con sottotitoli — video con sottotitoli parola per parola, creabile con un clic per podcast, note vocali e clip social. Scaricabile e condivisibile.
- Censura parole — cerca qualsiasi parola e silenzia ogni occorrenza, poi scarica l'audio pulito (si abbina al nostro Rimozione Volgarità).
Modifica la trascrizione — correggi errori, trova & sostituisci
La trascrizione automatica non è mai perfetta, quindi la trascrizione è completamente modificabile. Premi ✎ Edit e clicca su qualsiasi riga per riscrivere una parola mal interpretata — le tue modifiche vengono salvate automaticamente e si riflettono in ogni esportazione (.txt, .srt, .vtt e il resto). Usa Find per saltare a ogni punto in cui appare una parola, e Sostituisci tutto per correggerla ovunque in una volta sola — perfetto per correggere un nome, un brand o un termine che Whisper ha trascritto male (ad esempio, ogni "Mark" → "Marc"). La corrispondenza è a parola intera, quindi sostituire "a" non modificherà la lettera "a" all'interno di altre parole. Preferisci l'output grezzo? Passa tra i Original and Edited tab in qualsiasi momento — l'originale intatto rimane salvato con il file.
Per cosa non è l'ideale
- Rumore di fondo elevato, musica sotto la voce o più oratori che si sovrappongono — il piccolo Whisper fatica con questi.
- Accenti marcati o dialetti non comuni — i modelli Whisper più grandi li gestiscono meglio ma sono troppo pesanti per un browser.
- Diarizzazione degli oratori ("chi ha detto cosa") — non supportata da Whisper-tiny.
- File più lunghi di 60 minuti — limitiamo la lunghezza dell'input per mantenere la RAM del browser sotto controllo.
Traduci audio in inglese
Spunta "Traduci in inglese" e Whisper trasforma qualsiasi audio non inglese in testo inglese. Podcast spagnolo → trascrizione inglese. Intervista in mandarino → note in inglese. Strumento di Traduzione Audio dedicato qui se la traduzione è la tua esigenza principale.
Trascrivi audio in 99 lingue
SnipSound trascrive il parlato in 99 lingue, con un selettore di lingue ricercabile e vera rilevazione automatica della lingua — esegue un vero e proprio passaggio di identificazione della lingua, cosa che la maggior parte degli strumenti in-browser non può fare. Su parlato chiaro, la precisione è elevata nelle principali lingue, tra cui inglese, spagnolo, francese, portoghese, italiano, tedesco, russo, cinese e giapponese — quindi gestisce "transcribir audio a texto", "transcrire audio en texte", "trascrizione audio", "音声文字起こし" e altro ancora, direttamente nel tuo browser.
Un paio di note oneste così sai cosa aspettarti: i dati di precisione si riferiscono al clear parlato — accenti marcati o audio rumoroso riducono la precisione su qualsiasi modello on-device — e alcune lingue con meno risorse (tra cui hindi/urdu) sono meno precise sul modello gratuito, motivo per cui il selettore di lingue le contrassegna con un livello di precisione limitata; per queste, il modello Pro offre risultati migliori. Per cinese e giapponese, trascrizione e sottotitoli sono eccellenti; la precisione del clic parola per parola è massima nelle lingue con scrittura latina. Le pagine localizzate per le principali lingue stanno per essere rilasciate — o semplicemente apri lo strumento e scegli la tua lingua (o lascia che l'auto-rilevamento lo faccia).
Più di una trascrizione
Oltre il parlato-testo, lo stesso strumento gratuito legge file lunghi ad alta voce mentre li trascrive (risultati in streaming), ti permette di modificare una parola mantenendo la sua esatta tempistica nei sottotitoli,mostra un' most-said-words analisi, e trova e riproduce ogni occorrenza di una parola. Quando hai finito, un clic invia il tuo il video con la trascrizione sincronizzata parola per parola direttamente al editor video con i sottotitoli già sulla timeline — e riaprendo un file in seguito, la sua trascrizione viene ripristinata all'istante.
Modalità revisione Il punto di forza è: l'IA sottolinea ogni parola di cui non è del tutto sicura, e un pulsante Revisiona ti guida attraverso ognuna, riproducendo solo l'audio di quella parola così puoi mantenerla o correggerla con un tocco — e le tue decisioni vengono salvate. Non è tutto: Filtri ricerca filtrano la trascrizione per frasi corrispondenti e evidenziano dove cadono sulla forma d'onda, Trova & sostituisci tutto corregge un nome mal interpretato ovunque in una volta sola (tempi mantenuti), modifiche auto-save e ripristina al nuovo caricamento, il video con i sottotitoli si adatta al rapporto d'aspetto della tua sorgente con i propri controlli di riproduzione, e c'è una visualizzazione a schermo intero della trascrizione con timestamp a livello di frase.
SnipSound contro Otter.ai, Rev & Descript
Le persone di solito confrontano SnipSound con trascrittori cloud a pagamento come Otter.ai, Rev and Descript. La differenza fondamentale: questi caricano il tuo audio sui loro server e addebitano un abbonamento mensile o una tariffa al minuto, mentre SnipSound gira gratis nel tuo browser senza caricare nulla — solo il piano Pro opzionale ha un costo, ed è a consumo senza abbonamento.
| Feature | SnipSound | Otter.ai | Rev | Descript |
|---|---|---|---|---|
| Cost | Gratis — Pro è a consumo, senza abbonamento | Freemium, con abbonamento mensile | A pagamento al minuto / abbonamento | Con abbonamento mensile |
| Il tuo audio | Rimane nel tuo browser — mai caricato | Caricato sui loro server | Uploaded | Uploaded |
| Account richiesto | None | Required | Required | Required |
| Lingue (supporto del modello) | 99 | Fewer | Fewer | Fewer |
| Timestamp a livello di parola | Yes | Yes | Yes | Yes |
| Crea un video sottotitolato | Sì, integrato | No | No | Sì (a pagamento) |
| Limite gratuito per file | 60 min, file illimitati | Minuti gratuiti limitati | Solo prova | Gratuito limitato |
Un'alternativa gratuita e privata a Otter.ai per chi non vuole che il proprio audio finisca su un server di terze parti. Per l'audio più difficile, SnipSound Pro esegue il modello più grande su GPU cloud, paghi in base all'utilizzo.
Quanto è preciso — e quando vale la pena passare a Pro?
Su audio pulito, con un solo oratore, il modello gratuito integrato nel browser (Whisper base di OpenAI) è molto preciso. Nei nostri test, inglese e spagnolo hanno raggiunto circa il 100%, cinese e giapponese circa il 100% di accuratezza del contenuto, e francese circa l'88%. Su un benchmark standard di parlato pulito, questo è circa 95%; the Pro model (Whisper large-v3) is around 98%. L'audio reale con rumore di fondo, musica, accenti forti o oratori che si sovrappongono è più difficile per qualsiasi modello, quindi l'accuratezza è inferiore — non rivendichiamo mai il 99%.
Cosa il modello gratuito fatica a gestire (e dove Pro è d'aiuto)
- Accenti forti, nomi propri, gergo e acronimi — il modello gratuito più piccolo fraintende più spesso le parole rare; il modello più grande di Pro le capisce correttamente più spesso.
- Musica o rumore di fondo sotto la voce, e oratori che si sovrappongono — entrambi sono difficili per un modello delle dimensioni di un browser, e nessuno dei due modelli etichetta chi ha detto cosa.
- Alcune lingue. Il modello gratuito è ottimo per le principali lingue europee, più cinese e giapponese, ma meno efficace su altre. Ad esempio, Hindi con il modello gratuito può apparire nello script correlato script urdu con slittamento fonetico — hindi e urdu sono la stessa lingua parlata, e questa è una limitazione nota del modello più piccolo. La tempistica delle parole resta precisa; è il testo a risentirne. Il modello Pro più grande gestisce l'hindi e altre lingue più difficili molto meglio.
| Lingua (audio chiaro) | Modello gratuito nel browser |
|---|---|
| Inglese, Spagnolo | ~100% |
| Cinese, Giapponese | ~100% preciso nel contenuto |
| French | ~88% |
| Hindi | Tempistica parole precisa; testo meno preciso nel gratuito — usa Pro |
I sottotitoli sincronizzati parola per parola sono stati verificati per inglese, spagnolo, francese, hindi, cinese e giapponese (inclusi script non latini) — ogni parola temporizzata, copertura audio del 98–100%. "99 lingue" si riferisce al supporto linguistico del modello; la precisione varia in base alla lingua e alla qualità audio, e il modello gratuito è ~95% / Pro ~98% su audio chiaro.