IA Grátis Transcrição de Áudio & Vídeo
A ferramenta gratuita do SnipSound para transcrever áudio ou vídeo em texto, em 99 idiomas, direto no seu navegador — transforme uma gravação de voz, podcast, entrevista ou lembrete de voz em texto. Comece timestamps por palavra com destaque estilo karaokê, crie um vídeo legendado, apite qualquer palavra, e exporte para .txt, .srt ou .vtt. Seus arquivos nunca saem do seu dispositivo. Sem necessidade de cadastro.
Arraste um arquivo de áudio ou vídeo
ou clique para procurar.
Não tem um arquivo? Grave um com nosso gravador de voz para testar como a transcrição funciona.
100% no seu navegador. O áudio permanece no seu dispositivo. O modelo Whisper AI é baixado uma vez (~75 MB) dos nossos servidores e depois roda localmente para cada transcrição. Não podemos acessar seu áudio porque ele nunca sai do seu computador. Política de privacidade.
Transcript
Quanto tempo leva para transcrever seu arquivo?
A versão gratuita funciona 100% no seu navegador — privada, $0, ótima para a maioria dos arquivos. Para arquivos longos ou precisão máxima, o Pro roda em GPUs na nuvem em segundos.
Qual a pegadinha do grátis?
Não há pegadinha escondida — é realmente gratuito, ilimitado e privado, porque roda no seu próprio dispositivo em vez dos nossos servidores, então não há nada para cobrarmos. A única contrapartida é time: seu computador não é tão rápido quanto uma GPU na nuvem, então a transcrição leva alguns minutos. Para clipes curtos, isso é quase imperceptível. Para arquivos longos a espera se acumula — e esse é o único caso em que Pro mostra seu valor: o mesmo trabalho em GPUs na nuvem em segundos, com maior precisão, em qualquer dispositivo.
Grátis vs Pro — tempos de transcrição típicos
| Duração do arquivo | Grátis — no seu navegador* | Pro — nuvem |
|---|---|---|
| 10 min | Cerca de 2–3 min | ~22 sec |
| 30 min | Cerca de 7–8 min | ~45 sec |
| 1 hour | ~15 min | ~1,5 min |
| 2 hours | dividido em partes de ≤60 min primeiro | ~2,5 min |
*Free times on a typical laptop with a WebGPU browser (Chrome/Edge); older devices without a GPU can be 2–4× slower. Free is capped at 60 minutes per file. Pro runs on cloud GPUs at the same speed on any device, using the larger large-v3 model for higher accuracy.
O que torna a transcrição gratuita mais rápida?
- Use um navegador com WebGPU — Chrome ou Edge (e o Firefox mais recente) executam no seu GPU, aproximadamente 2x mais rápido do que um navegador apenas com CPU. O Brave desativa o WebGPU por padrão.
- Mantenha seu notebook conectado — o modo de economia de bateria limita sua CPU/GPU e pode quase dobrar o tempo.
- Feche outras abas e aplicativos pesados — a transcrição usa sua CPU/GPU e memória; libere-os.
- Um dispositivo com GPU é bem mais rápido — um celular ou notebook recente com WebGPU supera uma máquina antiga apenas com CPU com folga (um celular moderno pode até ser mais rápido que um notebook sem GPU).
- A primeira execução baixa o modelo uma vez — é uma espera única; toda transcrição depois disso a ignora.
Velocidade por dispositivo & navegador — um arquivo de 16 minutos
| Sua configuração | Tempo para transcrever (16 min) |
|---|---|
| Notebook ou celular com WebGPU (Chrome, Edge, Firefox mais recente) | ~4 min |
| Celular, apenas CPU (sem WebGPU) | Cerca de 5–6 min |
| Laptop sem WebGPU (Padrão do Brave, navegador antigo) | ~8 min |
| Notebook antigo, fallback de núcleo único | até ~18 min |
| Qualquer dispositivo com Pro (GPUs na nuvem) | ~29 sec |
Measured on our own benchmarks with the Whisper base model in-browser (large-v3-turbo for Pro). Your exact time varies with your device's chip and the audio itself.
Transcrição de áudio & vídeo com IA gratuita e privada — como funciona
A ferramenta de transcrição do SnipSound usa o modelo de código aberto da OpenAI Whisper de reconhecimento de fala que roda inteiramente no seu navegador via WebAssembly. Arraste o áudio or vídeo — para vídeos, extraímos a faixa de áudio automaticamente. Na primeira vez que você clica Transcribe, seu navegador baixa um arquivo de modelo de ~75 MB dos nossos servidores; depois disso, cada transcrição é totalmente local. Seu arquivo nunca é enviado para nenhum servidor — nem o nosso, nem o da OpenAI, nem de ninguém.
Trabalhando especificamente com vídeo? Experimente o Vídeo para Texto. Precisa apenas de um arquivo de legenda? O Gerador de SRT exporta arquivos .srt/.vtt prontos para usar.
Para que serve
- Transcrever entrevistas de podcast, gravações de reuniões, memorandos de voz, palestras ou qualquer áudio com fala clara.
- Adicionar legendas a um vídeo — gere legendas automáticas para download nos formatos .srt e .vtt, com marcações de tempo precisas que podem ser usadas no YouTube, Vimeo ou qualquer editor.
- Uma alternativa gratuita e privada a Otter, Rev e Descript para jornalistas, pesquisadores, estudantes e criadores — sem assinatura, sem upload, sem limite de tempo por arquivo.
- Áudio sensível à privacidade que você não quer em um servidor de terceiros — anotações de terapia, entrevistas confidenciais, reuniões internas.
- Timestamps por palavra — destaque de palavras estilo karaokê e clique para navegar, para você extrair uma citação exata ou criar legendas precisas.
- Transforme áudio em vídeo legendado — vídeo com legenda palavra por palavra, com um clique, para podcasts, notas de voz e clipes sociais, para baixar e compartilhar.
- Censurar palavras — procure qualquer palavra e silencie todas as ocorrências, depois baixe o áudio limpo (combina com nosso Removedor de Palavrões).
Editar a transcrição — corrigir erros, localizar & substituir
A transcrição automática nunca é perfeita, então a transcrição é totalmente editável. Clique em ✎ Edit e clique em qualquer linha para redigitar uma palavra mal ouvida — suas alterações são salvas automaticamente e refletem em todas as exportações (.txt, .srt, .vtt e as demais). Use Find para ir para todos os lugares onde uma palavra aparece, e Substituir tudo para corrigir em todos os lugares de uma vez — perfeito para corrigir um nome, marca ou termo que o Whisper transcreveu errado (por exemplo, todo "Mark" → "Marc"). A correspondência é de palavra inteira, então substituir "a" não afetará a letra 'a' dentro de outras palavras. Prefere a saída bruta? Alterne entre as Original and Edited abas a qualquer momento — o original intocado permanece salvo com o arquivo.
Para o que não é tão bom
- Ruído de fundo intenso, música por trás da voz ou múltiplos falantes se sobrepondo — o Whisper tem dificuldade com isso.
- Sotaques fortes ou dialetos não-padrão — modelos maiores do Whisper lidam melhor com isso, mas são muito pesados para um navegador.
- Diarização de falantes ("quem disse o quê") — não suportado pelo Whisper-tiny.
- Arquivos com mais de 60 minutos — limitamos o tempo de entrada para manter a RAM do navegador sob controle.
Traduzir áudio para inglês
Marque "Traduzir para inglês" e o Whisper transforma qualquer áudio não-inglês em texto em inglês. Podcast em espanhol → transcrição em inglês. Entrevista em mandarim → anotações em inglês. Ferramenta de Tradução de Áudio dedicada aqui se a tradução é sua principal necessidade.
Transcreva áudio em 99 idiomas
SnipSound transcreve falas em 99 idiomas, com um seletor de idiomas pesquisável e detecção automática de idioma de verdade — ele faz uma identificação de idioma de verdade, o que a maioria das ferramentas no navegador não consegue. Em falas claras, a precisão é alta em idiomas principais, incluindo inglês, espanhol, francês, português, italiano, alemão, russo, chinês e japonês — então ele consegue lidar com "transcribir audio a texto", "transcrire audio en texte", "trascrizione audio", "音声文字起こし" e muito mais, direto no seu navegador.
Algumas observações sinceras para você saber o que esperar: os números de precisão são para clear fala — sotaques fortes ou áudio ruidoso reduzem a precisão em qualquer modelo no dispositivo — e alguns idiomas com poucos recursos (hindi/urdu entre eles) são mais fracos no modelo gratuito, é por isso que o seletor de idiomas marca um nível de precisão limitada para eles; para esses, o modelo Pro tem um desempenho melhor. Para chinês e japonês, a transcrição e as legendas são excelentes; a precisão do clique palavra por palavra é mais forte em idiomas de escrita latina. Páginas localizadas para os principais idiomas estão chegando — ou apenas abra a ferramenta e escolha seu idioma (ou deixe a detecção automática fazer isso).
Mais do que uma transcrição
Além da conversão de fala em texto, a mesma ferramenta gratuita lê arquivos longos em voz alta enquanto transcreve (resultados em tempo real), permite que você edite uma palavra mantendo o tempo exato da legenda, mostra uma most-said-words análise, e encontra e reproduz cada ocorrência de uma palavra. Quando você terminar, um clique envia seu Vídeo com transcrição sincronizada por palavra, direto para o gratuito Editor de vídeo com legendas já inseridas na linha do tempo — e reabrir um arquivo depois restaura sua transcrição instantaneamente.
Modo Revisão é o destaque: a IA sublinha qualquer palavra que não tem certeza, e um botão de Revisão te guia por cada uma delas, reproduzindo só o áudio da palavra para você manter ou corrigir com um toque — e suas escolhas são salvas. Tem mais: Filtros de busca a transcrição para frases correspondentes e destaca onde elas aparecem na forma de onda, localizar & substituir tudo corrige um nome mal-entendido em toda parte de uma vez (mantendo os tempos), edita auto-save e restaura no reenvio, o vídeo com legendas se adapta à proporção do seu vídeo original com seus próprios controles de reprodução, e há uma visualização da transcrição em tela cheia com marcações de tempo por frase.
SnipSound x Otter.ai, Rev & Descript
As pessoas costumam comparar o SnipSound com transcritores de nuvem pagos como Otter.ai, Rev and Descript. A principal diferença: eles carregam seu áudio para os servidores deles e cobram uma assinatura mensal ou uma taxa por minuto, enquanto o SnipSound roda grátis no seu navegador sem nenhum upload — apenas a versão Pro opcional tem custo, e é pago por uso, sem assinatura.
| Feature | SnipSound | Otter.ai | Rev | Descript |
|---|---|---|---|---|
| Cost | Grátis — Pro é pago por uso, sem assinatura | Freemium, pago mensalmente | Pago por minuto / assinatura | Pago mensalmente |
| Seu áudio | Fica no seu navegador — nunca é enviado | Carregado para os servidores deles | Uploaded | Uploaded |
| Conta necessária | None | Required | Required | Required |
| Idiomas (suporte de modelo) | 99 | Fewer | Fewer | Fewer |
| Timestamps por palavra | Yes | Yes | Yes | Yes |
| Fazer um vídeo legendado | Sim, integrado | No | No | Sim (pago) |
| Limite gratuito por arquivo | 60 min, arquivos ilimitados | Minutos grátis limitados | Apenas teste | Grátis limitado |
Uma alternativa gratuita e privada ao Otter.ai para quem não quer seu áudio em um servidor de terceiros. Para os áudios mais difíceis, SnipSound Pro roda o maior modelo em GPUs na nuvem, pague por uso.
Qual a precisão — e quando vale a pena usar o Pro?
Em áudios limpos e com um único locutor, o modelo gratuito no navegador (Whisper base da OpenAI) é muito preciso. Em nossos próprios testes, inglês e espanhol retornaram cerca de 100%, chinês e japonês ~100% precisos em conteúdo, e francês cerca de 88%. Em um benchmark padrão de fala limpa, isso é aproximadamente 95%; the Pro model (Whisper large-v3) is around 98%. Áudios do mundo real com ruído de fundo, música, sotaques fortes ou falantes sobrepostos são mais difíceis para qualquer modelo, então a precisão é menor — nunca afirmamos 99%.
O que o modelo gratuito tem dificuldade (e onde o Pro ajuda)
- Sotaques fortes, nomes próprios, termos técnicos e siglas — o modelo gratuito menor entende palavras raras de forma errada com mais frequência; o modelo maior do Pro as acerta na maioria das vezes.
- Música ou ruído de fundo sob a voz, e falantes sobrepostos — ambos são difíceis para um modelo do tamanho de navegador, e nenhum dos modelos identifica quem disse o quê.
- Alguns idiomas. O modelo gratuito é excelente para as principais línguas europeias, além de chinês e japonês, mas é mais fraco em outras. Por exemplo, Hindi no modelo gratuito pode aparecer no script relacionado script urdu com desvio fonético — hindi e urdu são a mesma língua falada, e esta é uma limitação conhecida do modelo menor. A sincronização da palavra permanece precisa; é o texto que sofre. O modelo maior do Pro lida com hindi e outras línguas mais difíceis muito melhor.
| Idioma (fala limpa) | Modelo gratuito no navegador |
|---|---|
| Inglês, Espanhol | ~100% |
| Chinês, Japonês | ~100% preciso no conteúdo |
| French | ~88% |
| Hindi | Sincronização da palavra precisa; texto mais fraco no gratuito — use Pro |
Legendas sincronizadas palavra por palavra foram verificadas em inglês, espanhol, francês, hindi, chinês e japonês (incluindo scripts não latinos) — cada palavra sincronizada, 98–100% de cobertura de áudio. "99 idiomas" refere-se ao suporte de idiomas do modelo; a precisão varia de acordo com o idioma e a qualidade do áudio, e o gratuito é ~95% / Pro ~98% em fala limpa.