Free Audio Transcription

AI Gratuita Trascrizione Audio & Video

Lo strumento gratuito di trascrizione di SnipSound trasforma audio o video in testo in 99 lingue, direttamente nel tuo browser — trasforma una registrazione vocale, un podcast, un'intervista o un memo vocale in testo (trascrivi audio in testo, da voce a testo, converti audio in testo, da suono a testo). Inizia timestamp a livello di parola con evidenziazione stile karaoke, crea un video sottotitolato, metti un bip su qualsiasi parola ed esporta in .txt, .srt o .vtt. I file non lasciano mai il tuo dispositivo. Nessuna registrazione.

Nessun file disponibile?

Trascina un file audio o video

o clicca per sfogliare.

MP3WAVOGGFLACAACM4AWEBMMP4MOV

Non hai un file? Registrane uno con il nostro registratore vocale per testare come funziona la trascrizione.

100% nel tuo browser. L'audio rimane sul tuo dispositivo. Il modello AI Whisper viene scaricato una sola volta (~75 MB) dai nostri server, poi funziona localmente per ogni trascrizione. Non possiamo accedere al tuo audio perché non lascia mai il tuo computer. Informativa sulla privacy.

file.mp3
In che lingua è l'audio?
Caricamento modello… 0%

Transcript

Opzioni di esportazione:

Quanto tempo ci vorrà per trascrivere il tuo file?

Gratuito: funziona al 100% nel tuo browser — privato, a costo zero, ideale per la maggior parte dei file. Per file lunghi o massima precisione, Pro funziona su GPU cloud in pochi secondi.

16 min
📁 per compilare automaticamente
● Gratuito · nel tuo browser
100% privato · a costo zero
◆ Pro · su cloud
Fastest · larger large-v3 model
Rilevamento del tuo dispositivo…
Estimates from our own benchmarks (Whisper base in-browser vs large-v3-turbo on cloud GPUs). Free scales with your device; Pro is the same speed on any device.

Qual è il trucco del gratuito?

Non c'è nessun trucco nascosto: è davvero gratuito, illimitato e privato, perché funziona su il tuo dispositivo invece che sui nostri server, quindi non abbiamo nulla da farti pagare. L'unico compromesso è time: il tuo computer non è veloce come una GPU cloud, quindi la trascrizione richiede qualche minuto. Per i clip brevi è quasi impercettibile. Per i file lunghi l'attesa si fa sentire — ed è l'unico caso in cui Pro ripaga l'investimento: lo stesso lavoro su GPU cloud in pochi secondi, con maggiore precisione, su qualsiasi dispositivo.

Gratuito vs Pro — tempi di trascrizione tipici

Lunghezza fileGratuito — nel tuo browser*Pro — su cloud
10 minCirca 2–3 min~22 sec
30 minCirca 7–8 min~45 sec
1 hour~15 min~1,5 min
2 hoursdiviso prima in parti da ≤60 minuti~2,5 min

*Free times on a typical laptop with a WebGPU browser (Chrome/Edge); older devices without a GPU can be 2–4× slower. Free is capped at 60 minutes per file. Pro runs on cloud GPUs at the same speed on any device, using the larger large-v3 model for higher accuracy.

Cosa rende più veloce la trascrizione gratuita?

Velocità per dispositivo & browser — un file di 16 minuti

La tua configurazioneTempo per trascrivere (16 min)
Portatile o telefono con WebGPU (Chrome, Edge, ultimo Firefox)~4 min
Telefono, solo CPU (senza WebGPU)Circa 5–6 min
Laptop senza WebGPU (Brave predefinito, browser più vecchio)~8 min
Vecchio portatile, fallback a singolo corefino a ~18 min
Qualsiasi dispositivo con Pro (GPU cloud)~29 sec

Measured on our own benchmarks with the Whisper base model in-browser (large-v3-turbo for Pro). Your exact time varies with your device's chip and the audio itself.

Trascrizione audio & video AI gratuita e privata — come funziona

Lo strumento di trascrizione di SnipSound utilizza il modello open-source di OpenAI Whisper di riconoscimento vocale che gira interamente nel tuo browser tramite WebAssembly. Trascina l'audio or video — per i video estraiamo automaticamente la traccia audio. La prima volta che clicchi Transcribe, il tuo browser scarica un file modello di circa 75 MB dai nostri server; dopodiché, ogni trascrizione è completamente locale. Il tuo file non viene mai caricato su nessun server — né il nostro, né quello di OpenAI, né quello di nessun altro.

Lavori con i video? Prova Video a Testo. Ti serve solo un file di sottotitoli? Il Generatore SRT esporta file .srt/.vtt pronti all'uso.

A cosa serve

Modifica la trascrizione — correggi errori, trova & sostituisci

La trascrizione automatica non è mai perfetta, quindi la trascrizione è completamente modificabile. Premi ✎ Edit e clicca su qualsiasi riga per riscrivere una parola mal interpretata — le tue modifiche vengono salvate automaticamente e si riflettono in ogni esportazione (.txt, .srt, .vtt e il resto). Usa Find per saltare a ogni punto in cui appare una parola, e Sostituisci tutto per correggerla ovunque in una volta sola — perfetto per correggere un nome, un brand o un termine che Whisper ha trascritto male (ad esempio, ogni "Mark" → "Marc"). La corrispondenza è a parola intera, quindi sostituire "a" non modificherà la lettera "a" all'interno di altre parole. Preferisci l'output grezzo? Passa tra i Original and Edited tab in qualsiasi momento — l'originale intatto rimane salvato con il file.

Per cosa non è l'ideale

Traduci audio in inglese

Spunta "Traduci in inglese" e Whisper trasforma qualsiasi audio non inglese in testo inglese. Podcast spagnolo → trascrizione inglese. Intervista in mandarino → note in inglese. Strumento di Traduzione Audio dedicato qui se la traduzione è la tua esigenza principale.

Trascrivi audio in 99 lingue

SnipSound trascrive il parlato in 99 lingue, con un selettore di lingue ricercabile e vera rilevazione automatica della lingua — esegue un vero e proprio passaggio di identificazione della lingua, cosa che la maggior parte degli strumenti in-browser non può fare. Su parlato chiaro, la precisione è elevata nelle principali lingue, tra cui inglese, spagnolo, francese, portoghese, italiano, tedesco, russo, cinese e giapponese — quindi gestisce "transcribir audio a texto", "transcrire audio en texte", "trascrizione audio", "音声文字起こし" e altro ancora, direttamente nel tuo browser.

Un paio di note oneste così sai cosa aspettarti: i dati di precisione si riferiscono al clear parlato — accenti marcati o audio rumoroso riducono la precisione su qualsiasi modello on-device — e alcune lingue con meno risorse (tra cui hindi/urdu) sono meno precise sul modello gratuito, motivo per cui il selettore di lingue le contrassegna con un livello di precisione limitata; per queste, il modello Pro offre risultati migliori. Per cinese e giapponese, trascrizione e sottotitoli sono eccellenti; la precisione del clic parola per parola è massima nelle lingue con scrittura latina. Le pagine localizzate per le principali lingue stanno per essere rilasciate — o semplicemente apri lo strumento e scegli la tua lingua (o lascia che l'auto-rilevamento lo faccia).

Più di una trascrizione

Oltre il parlato-testo, lo stesso strumento gratuito legge file lunghi ad alta voce mentre li trascrive (risultati in streaming), ti permette di modificare una parola mantenendo la sua esatta tempistica nei sottotitoli,mostra un' most-said-words analisi, e trova e riproduce ogni occorrenza di una parola. Quando hai finito, un clic invia il tuo il video con la trascrizione sincronizzata parola per parola direttamente al editor video con i sottotitoli già sulla timeline — e riaprendo un file in seguito, la sua trascrizione viene ripristinata all'istante.

Modalità revisione Il punto di forza è: l'IA sottolinea ogni parola di cui non è del tutto sicura, e un pulsante Revisiona ti guida attraverso ognuna, riproducendo solo l'audio di quella parola così puoi mantenerla o correggerla con un tocco — e le tue decisioni vengono salvate. Non è tutto: Filtri ricerca filtrano la trascrizione per frasi corrispondenti e evidenziano dove cadono sulla forma d'onda, Trova & sostituisci tutto corregge un nome mal interpretato ovunque in una volta sola (tempi mantenuti), modifiche auto-save e ripristina al nuovo caricamento, il video con i sottotitoli si adatta al rapporto d'aspetto della tua sorgente con i propri controlli di riproduzione, e c'è una visualizzazione a schermo intero della trascrizione con timestamp a livello di frase.

SnipSound contro Otter.ai, Rev & Descript

Le persone di solito confrontano SnipSound con trascrittori cloud a pagamento come Otter.ai, Rev and Descript. La differenza fondamentale: questi caricano il tuo audio sui loro server e addebitano un abbonamento mensile o una tariffa al minuto, mentre SnipSound gira gratis nel tuo browser senza caricare nulla — solo il piano Pro opzionale ha un costo, ed è a consumo senza abbonamento.

FeatureSnipSoundOtter.aiRevDescript
CostGratis — Pro è a consumo, senza abbonamentoFreemium, con abbonamento mensileA pagamento al minuto / abbonamentoCon abbonamento mensile
Il tuo audioRimane nel tuo browser — mai caricatoCaricato sui loro serverUploadedUploaded
Account richiestoNoneRequiredRequiredRequired
Lingue (supporto del modello)99FewerFewerFewer
Timestamp a livello di parolaYesYesYesYes
Crea un video sottotitolatoSì, integratoNoNoSì (a pagamento)
Limite gratuito per file60 min, file illimitatiMinuti gratuiti limitatiSolo provaGratuito limitato

Un'alternativa gratuita e privata a Otter.ai per chi non vuole che il proprio audio finisca su un server di terze parti. Per l'audio più difficile, SnipSound Pro esegue il modello più grande su GPU cloud, paghi in base all'utilizzo.

Quanto è preciso — e quando vale la pena passare a Pro?

Su audio pulito, con un solo oratore, il modello gratuito integrato nel browser (Whisper base di OpenAI) è molto preciso. Nei nostri test, inglese e spagnolo hanno raggiunto circa il 100%, cinese e giapponese circa il 100% di accuratezza del contenuto, e francese circa l'88%. Su un benchmark standard di parlato pulito, questo è circa 95%; the Pro model (Whisper large-v3) is around 98%. L'audio reale con rumore di fondo, musica, accenti forti o oratori che si sovrappongono è più difficile per qualsiasi modello, quindi l'accuratezza è inferiore — non rivendichiamo mai il 99%.

Cosa il modello gratuito fatica a gestire (e dove Pro è d'aiuto)

Lingua (audio chiaro)Modello gratuito nel browser
Inglese, Spagnolo~100%
Cinese, Giapponese~100% preciso nel contenuto
French~88%
HindiTempistica parole precisa; testo meno preciso nel gratuito — usa Pro

I sottotitoli sincronizzati parola per parola sono stati verificati per inglese, spagnolo, francese, hindi, cinese e giapponese (inclusi script non latini) — ogni parola temporizzata, copertura audio del 98–100%. "99 lingue" si riferisce al supporto linguistico del modello; la precisione varia in base alla lingua e alla qualità audio, e il modello gratuito è ~95% / Pro ~98% su audio chiaro.

Domande frequenti

È davvero gratuito?
Sì. Nessun account, nessuna carta, nessun limite di utilizzo. La trascrizione viene eseguita nel tuo browser utilizzando il modello open-source Whisper di OpenAI.
Il mio audio viene caricato da qualche parte?
No. Il tuo file audio rimane nel tuo browser. Il modello AI viene scaricato dai nostri server una sola volta e memorizzato nella cache localmente — dopo di che, la trascrizione è completamente offline.
Quali lingue sono supportate?
99 lingue, tra cui inglese, spagnolo, mandarino, hindi, arabo, francese, portoghese, russo, giapponese, tedesco, coreano, italiano e molte altre. Il rilevamento automatico identifica la lingua dai primi secondi.
Può tradurre l'audio in inglese?
Sì. Spunta "Traduci in inglese" e Whisper renderà qualsiasi audio non inglese come testo inglese. Oppure usa lo strumento dedicato Traduttore Audio.
Quanto è accurata la trascrizione?
Molto buono per il parlato chiaro in 99 lingue. L'accuratezza può diminuire con accenti marcati, musica di sottofondo, oratori che si sovrappongono o audio rumoroso, perché lo strumento gratuito esegue un modello più leggero nel tuo browser. Per l'audio più difficile, SnipSound Pro esegue il modello grande di punta su GPU cloud per la massima accuratezza — paghi per l'utilizzo, nessun abbonamento mensile — e puoi comunque modificare il risultato. In ogni caso, lo strumento gratuito non carica mai il tuo file.
Come si confronta con Otter, Rev o Descript?
Questi sono servizi cloud a pagamento (circa $10–30/mese) che caricano il tuo audio sui loro server. SnipSound trascrive gratuitamente, direttamente nel tuo browser — nulla viene caricato, nessun account, nessuna tariffa mensile, nessun limite di tempo per file. Quando hai bisogno della massima accuratezza su audio difficili, SnipSound Pro esegue il modello più grande nel cloud su base pay-per-use invece di un abbonamento.
Posso trascrivere un video di YouTube?
Sì. Scarica il video di YouTube (o solo il suo audio) e trascina il file qui — lo trascriviamo localmente nel tuo browser e puoi esportare sottotitoli .srt/.vtt. Non preleviamo direttamente dai link di YouTube, ed è proprio questo che mantiene i tuoi dati privati.
Posso modificare la trascrizione?
Sì — clicca ✎ Edit e riscrivi qualsiasi riga, o usa Trova & Sostituisci tutto per correggere una parola ovunque in una volta sola. Le modifiche si riflettono in ogni esportazione (.txt, .srt, .vtt). La maggior parte dei trascrittori gratuiti sono solo in lettura.
Posso ottenere sottotitoli per un video?
Sì — scarica .srt o .vtt con timestamp. Funziona su YouTube, Vimeo, la maggior parte degli editor video. Trascina il tuo file video direttamente qui — estraiamo l'audio automaticamente.
C'è un limite di durata?
60 minuti per file. I file più lunghi usano troppa RAM del browser. Taglia con il nostro Taglia Audio o dividi con il Divisore Audio first.
Quanto tempo ci vuole per trascrivere un file audio di 1 ora?
Nel tuo browser, circa 15 minuti su un tipico laptop con un browser WebGPU — gratuito, privato, utilizzando il modello base Whisper. I dispositivi più vecchi senza GPU possono essere più lenti. Con SnipSound Pro on cloud GPUs it's roughly 1.5 minutes, the same speed on any device, using the larger large-v3 model. (Measured on whisper-base in-browser vs whisper-large-v3-turbo on cloud GPUs.)
La trascrizione gratuita basata su browser è accurata?
Sì — molto buono per il parlato chiaro in 99 lingue, eseguendo il modello base di Whisper direttamente sul tuo dispositivo senza alcun caricamento. L'accuratezza può diminuire con accenti marcati, musica di sottofondo o oratori che si sovrappongono, dove Pro's larger large-v3 model does better.
Qual è il modo più veloce per trascrivere un podcast o un'intervista lunghi?
Lo strumento gratuito nel browser funziona e rimane privato, ma il tempo di elaborazione dipende dalla lunghezza (circa 15 min per un file di 1 ora su un laptop tipico) ed è limitato a 60 minuti per file. L'opzione più veloce è SnipSound Pro, che elabora il tuo file su GPU cloud in circa 1-2 minuti, indipendentemente dalla lunghezza o dal dispositivo, con maggiore precisione.
Il mio browser o dispositivo influisce sulla velocità di trascrizione?
Sì, lo strumento gratuito funziona sul tuo hardware. Un browser con WebGPU (Chrome, Edge o l'ultima versione di Firefox) sfrutta la tua GPU ed è circa due volte più veloce rispetto a un browser che usa solo la CPU come Brave (che disabilita WebGPU per impostazione predefinita). Un file di 16 minuti richiede circa ~4 min con WebGPU, ~8 min su un laptop con solo CPU e fino a ~18 min su un vecchio sistema single-core di riserva. Tieni il laptop collegato all'alimentazione per evitare il rallentamento dovuto al risparmio energetico. Pro funziona su GPU cloud alla stessa velocità su qualsiasi dispositivo (circa 29 secondi per quel file).
Ci sono timestamp a livello di parola?
Sì — ogni parola è sincronizzata. La trascrizione evidenzia ogni parola karaoke-style durante la riproduzione audio, e puoi cliccare su qualsiasi parola per saltare a quel momento. Cerca una parola e verrà evidenziata sulla forma d'onda. La tempistica viene mantenuta nelle tue esportazioni .srt e .vtt.
Posso trasformare il mio audio in un video sottotitolato?
Sì — con un clic la tua trascrizione diventa un video sottotitolato parola per parola (testo grande animato) che puoi scaricare e condividere, ottimo per trasformare un estratto di podcast o una nota vocale in un video social senza editing. Oppure invialo direttamente all' Editor Video con sottotitoli sincronizzati parola per parola.
Posso censurare o 'bippare' una parola?
Sì — cerca qualsiasi parola (un nome, una parolaccia, qualsiasi cosa), censura ogni occorrenza, e scarica l'audio pulito. Raro per uno strumento gratuito nel browser. Per un'elaborazione dedicata, consulta il nostro Rimozione Volgarità.