Free Audio Transcription

IA Grátis Transcrição de Áudio & Vídeo

A ferramenta gratuita do SnipSound para transcrever áudio ou vídeo em texto, em 99 idiomas, direto no seu navegador — transforme uma gravação de voz, podcast, entrevista ou lembrete de voz em texto. Comece timestamps por palavra com destaque estilo karaokê, crie um vídeo legendado, apite qualquer palavra, e exporte para .txt, .srt ou .vtt. Seus arquivos nunca saem do seu dispositivo. Sem necessidade de cadastro.

Sem arquivo disponível?

Arraste um arquivo de áudio ou vídeo

ou clique para procurar.

MP3WAVOGGFLACAACM4AWEBMMP4MOV

Não tem um arquivo? Grave um com nosso gravador de voz para testar como a transcrição funciona.

100% no seu navegador. O áudio permanece no seu dispositivo. O modelo Whisper AI é baixado uma vez (~75 MB) dos nossos servidores e depois roda localmente para cada transcrição. Não podemos acessar seu áudio porque ele nunca sai do seu computador. Política de privacidade.

file.mp3
Em que idioma está o áudio?
Carregando modelo… 0%

Transcript

Opções de exportação:

Quanto tempo leva para transcrever seu arquivo?

A versão gratuita funciona 100% no seu navegador — privada, $0, ótima para a maioria dos arquivos. Para arquivos longos ou precisão máxima, o Pro roda em GPUs na nuvem em segundos.

16 min
📁 para preencher automaticamente
● Gratuito · no seu navegador
100% privado · $0
◆ Pro · na nuvem
Fastest · larger large-v3 model
Detectando seu dispositivo…
Estimates from our own benchmarks (Whisper base in-browser vs large-v3-turbo on cloud GPUs). Free scales with your device; Pro is the same speed on any device.

Qual a pegadinha do grátis?

Não há pegadinha escondida — é realmente gratuito, ilimitado e privado, porque roda no seu próprio dispositivo em vez dos nossos servidores, então não há nada para cobrarmos. A única contrapartida é time: seu computador não é tão rápido quanto uma GPU na nuvem, então a transcrição leva alguns minutos. Para clipes curtos, isso é quase imperceptível. Para arquivos longos a espera se acumula — e esse é o único caso em que Pro mostra seu valor: o mesmo trabalho em GPUs na nuvem em segundos, com maior precisão, em qualquer dispositivo.

Grátis vs Pro — tempos de transcrição típicos

Duração do arquivoGrátis — no seu navegador*Pro — nuvem
10 minCerca de 2–3 min~22 sec
30 minCerca de 7–8 min~45 sec
1 hour~15 min~1,5 min
2 hoursdividido em partes de ≤60 min primeiro~2,5 min

*Free times on a typical laptop with a WebGPU browser (Chrome/Edge); older devices without a GPU can be 2–4× slower. Free is capped at 60 minutes per file. Pro runs on cloud GPUs at the same speed on any device, using the larger large-v3 model for higher accuracy.

O que torna a transcrição gratuita mais rápida?

Velocidade por dispositivo & navegador — um arquivo de 16 minutos

Sua configuraçãoTempo para transcrever (16 min)
Notebook ou celular com WebGPU (Chrome, Edge, Firefox mais recente)~4 min
Celular, apenas CPU (sem WebGPU)Cerca de 5–6 min
Laptop sem WebGPU (Padrão do Brave, navegador antigo)~8 min
Notebook antigo, fallback de núcleo únicoaté ~18 min
Qualquer dispositivo com Pro (GPUs na nuvem)~29 sec

Measured on our own benchmarks with the Whisper base model in-browser (large-v3-turbo for Pro). Your exact time varies with your device's chip and the audio itself.

Transcrição de áudio & vídeo com IA gratuita e privada — como funciona

A ferramenta de transcrição do SnipSound usa o modelo de código aberto da OpenAI Whisper de reconhecimento de fala que roda inteiramente no seu navegador via WebAssembly. Arraste o áudio or vídeo — para vídeos, extraímos a faixa de áudio automaticamente. Na primeira vez que você clica Transcribe, seu navegador baixa um arquivo de modelo de ~75 MB dos nossos servidores; depois disso, cada transcrição é totalmente local. Seu arquivo nunca é enviado para nenhum servidor — nem o nosso, nem o da OpenAI, nem de ninguém.

Trabalhando especificamente com vídeo? Experimente o Vídeo para Texto. Precisa apenas de um arquivo de legenda? O Gerador de SRT exporta arquivos .srt/.vtt prontos para usar.

Para que serve

Editar a transcrição — corrigir erros, localizar & substituir

A transcrição automática nunca é perfeita, então a transcrição é totalmente editável. Clique em ✎ Edit e clique em qualquer linha para redigitar uma palavra mal ouvida — suas alterações são salvas automaticamente e refletem em todas as exportações (.txt, .srt, .vtt e as demais). Use Find para ir para todos os lugares onde uma palavra aparece, e Substituir tudo para corrigir em todos os lugares de uma vez — perfeito para corrigir um nome, marca ou termo que o Whisper transcreveu errado (por exemplo, todo "Mark" → "Marc"). A correspondência é de palavra inteira, então substituir "a" não afetará a letra 'a' dentro de outras palavras. Prefere a saída bruta? Alterne entre as Original and Edited abas a qualquer momento — o original intocado permanece salvo com o arquivo.

Para o que não é tão bom

Traduzir áudio para inglês

Marque "Traduzir para inglês" e o Whisper transforma qualquer áudio não-inglês em texto em inglês. Podcast em espanhol → transcrição em inglês. Entrevista em mandarim → anotações em inglês. Ferramenta de Tradução de Áudio dedicada aqui se a tradução é sua principal necessidade.

Transcreva áudio em 99 idiomas

SnipSound transcreve falas em 99 idiomas, com um seletor de idiomas pesquisável e detecção automática de idioma de verdade — ele faz uma identificação de idioma de verdade, o que a maioria das ferramentas no navegador não consegue. Em falas claras, a precisão é alta em idiomas principais, incluindo inglês, espanhol, francês, português, italiano, alemão, russo, chinês e japonês — então ele consegue lidar com "transcribir audio a texto", "transcrire audio en texte", "trascrizione audio", "音声文字起こし" e muito mais, direto no seu navegador.

Algumas observações sinceras para você saber o que esperar: os números de precisão são para clear fala — sotaques fortes ou áudio ruidoso reduzem a precisão em qualquer modelo no dispositivo — e alguns idiomas com poucos recursos (hindi/urdu entre eles) são mais fracos no modelo gratuito, é por isso que o seletor de idiomas marca um nível de precisão limitada para eles; para esses, o modelo Pro tem um desempenho melhor. Para chinês e japonês, a transcrição e as legendas são excelentes; a precisão do clique palavra por palavra é mais forte em idiomas de escrita latina. Páginas localizadas para os principais idiomas estão chegando — ou apenas abra a ferramenta e escolha seu idioma (ou deixe a detecção automática fazer isso).

Mais do que uma transcrição

Além da conversão de fala em texto, a mesma ferramenta gratuita lê arquivos longos em voz alta enquanto transcreve (resultados em tempo real), permite que você edite uma palavra mantendo o tempo exato da legenda, mostra uma most-said-words análise, e encontra e reproduz cada ocorrência de uma palavra. Quando você terminar, um clique envia seu Vídeo com transcrição sincronizada por palavra, direto para o gratuito Editor de vídeo com legendas já inseridas na linha do tempo — e reabrir um arquivo depois restaura sua transcrição instantaneamente.

Modo Revisão é o destaque: a IA sublinha qualquer palavra que não tem certeza, e um botão de Revisão te guia por cada uma delas, reproduzindo só o áudio da palavra para você manter ou corrigir com um toque — e suas escolhas são salvas. Tem mais: Filtros de busca a transcrição para frases correspondentes e destaca onde elas aparecem na forma de onda, localizar & substituir tudo corrige um nome mal-entendido em toda parte de uma vez (mantendo os tempos), edita auto-save e restaura no reenvio, o vídeo com legendas se adapta à proporção do seu vídeo original com seus próprios controles de reprodução, e há uma visualização da transcrição em tela cheia com marcações de tempo por frase.

SnipSound x Otter.ai, Rev & Descript

As pessoas costumam comparar o SnipSound com transcritores de nuvem pagos como Otter.ai, Rev and Descript. A principal diferença: eles carregam seu áudio para os servidores deles e cobram uma assinatura mensal ou uma taxa por minuto, enquanto o SnipSound roda grátis no seu navegador sem nenhum upload — apenas a versão Pro opcional tem custo, e é pago por uso, sem assinatura.

FeatureSnipSoundOtter.aiRevDescript
CostGrátis — Pro é pago por uso, sem assinaturaFreemium, pago mensalmentePago por minuto / assinaturaPago mensalmente
Seu áudioFica no seu navegador — nunca é enviadoCarregado para os servidores delesUploadedUploaded
Conta necessáriaNoneRequiredRequiredRequired
Idiomas (suporte de modelo)99FewerFewerFewer
Timestamps por palavraYesYesYesYes
Fazer um vídeo legendadoSim, integradoNoNoSim (pago)
Limite gratuito por arquivo60 min, arquivos ilimitadosMinutos grátis limitadosApenas testeGrátis limitado

Uma alternativa gratuita e privada ao Otter.ai para quem não quer seu áudio em um servidor de terceiros. Para os áudios mais difíceis, SnipSound Pro roda o maior modelo em GPUs na nuvem, pague por uso.

Qual a precisão — e quando vale a pena usar o Pro?

Em áudios limpos e com um único locutor, o modelo gratuito no navegador (Whisper base da OpenAI) é muito preciso. Em nossos próprios testes, inglês e espanhol retornaram cerca de 100%, chinês e japonês ~100% precisos em conteúdo, e francês cerca de 88%. Em um benchmark padrão de fala limpa, isso é aproximadamente 95%; the Pro model (Whisper large-v3) is around 98%. Áudios do mundo real com ruído de fundo, música, sotaques fortes ou falantes sobrepostos são mais difíceis para qualquer modelo, então a precisão é menor — nunca afirmamos 99%.

O que o modelo gratuito tem dificuldade (e onde o Pro ajuda)

Idioma (fala limpa)Modelo gratuito no navegador
Inglês, Espanhol~100%
Chinês, Japonês~100% preciso no conteúdo
French~88%
HindiSincronização da palavra precisa; texto mais fraco no gratuito — use Pro

Legendas sincronizadas palavra por palavra foram verificadas em inglês, espanhol, francês, hindi, chinês e japonês (incluindo scripts não latinos) — cada palavra sincronizada, 98–100% de cobertura de áudio. "99 idiomas" refere-se ao suporte de idiomas do modelo; a precisão varia de acordo com o idioma e a qualidade do áudio, e o gratuito é ~95% / Pro ~98% em fala limpa.

Perguntas frequentes

Isso é realmente grátis?
Sim. Sem conta, sem cartão, sem limites de uso. A transcrição é feita no seu navegador usando o modelo de código aberto Whisper da OpenAI.
Meu áudio é enviado para algum lugar?
Não. Seu arquivo de áudio permanece no seu navegador. O modelo de IA é baixado dos nossos servidores uma vez e armazenado em cache localmente — depois disso, a transcrição é totalmente offline.
Quais idiomas são suportados?
99 idiomas, incluindo Inglês, Espanhol, Mandarin, Hindi, Arabic, French, Portuguese, Russian, Japanese, German, Korean, Italian e muitos outros. A detecção automática identifica o idioma nos primeiros segundos.
Pode traduzir áudio para inglês?
Sim. Marque "Translate to English" e o Whisper transcreverá qualquer áudio que não seja English como texto English. Ou use a ferramenta dedicada Tradutor de Áudio.
Qual a precisão da transcrição?
Muito bom para fala clara em 99 idiomas. A precisão pode diminuir em sotaques fortes, música de fundo, falantes sobrepostos ou áudio ruidoso, porque a ferramenta gratuita executa um modelo mais leve no seu navegador. Para os áudios mais difíceis, SnipSound Pro executa o modelo grande de ponta em GPUs na nuvem para a mais alta precisão — pague por uso, sem assinatura mensal — e você ainda pode editar o resultado. De qualquer forma, a ferramenta gratuita nunca envia seu arquivo.
Como isso se compara a Otter, Rev ou Descript?
Esses são serviços de nuvem pagos (cerca de US$10–30/mês) que enviam seu áudio para os servidores deles. O SnipSound transcreve gratuitamente, diretamente no seu navegador — nada é enviado, sem conta, sem taxa mensal, sem limite de tempo por arquivo. Quando você precisa de precisão de alto nível em áudios difíceis, SnipSound Pro executa o maior modelo na nuvem com base no pagamento por uso, em vez de uma assinatura.
Posso transcrever um vídeo do YouTube?
Sim. Baixe o vídeo do YouTube (ou apenas o áudio) e solte o arquivo aqui — nós o transcrevemos localmente no seu navegador e você pode exportar legendas .srt/.vtt. Não extraímos de links do YouTube diretamente, o que é exatamente o que mantém seus dados privados.
Posso editar a transcrição?
Sim — clique em ✎ Edit e digite novamente qualquer linha, ou use Localizar & Substituir tudo para corrigir uma palavra em todos os lugares de uma vez. As edições são aplicadas a todas as exportações (.txt, .srt, .vtt). A maioria dos transcribers gratuitos são somente leitura.
Posso obter legendas para um vídeo?
Sim — baixe .srt ou .vtt com marcações de tempo. Funciona no YouTube, Vimeo, na maioria dos editores de vídeo. Solte seu arquivo de vídeo diretamente aqui — nós extraímos o áudio automaticamente.
Existe um limite de duração?
60 minutos por arquivo. Arquivos mais longos usam muita RAM do navegador. Corte com nossa Cortador de Áudio ou divida com a Divisor de Áudio first.
Quanto tempo leva para transcrever um arquivo de áudio de 1 hora?
No seu navegador, cerca de 15 minutos em um laptop comum com um navegador WebGPU — gratuito, privado, usando o modelo base Whisper. Dispositivos mais antigos sem GPU podem ser mais lentos. Com SnipSound Pro on cloud GPUs it's roughly 1.5 minutes, the same speed on any device, using the larger large-v3 model. (Measured on whisper-base in-browser vs whisper-large-v3-turbo on cloud GPUs.)
A transcrição gratuita no navegador é precisa?
Sim — muito bom para fala clara em 99 idiomas, executando o modelo base do Whisper diretamente no seu dispositivo sem nada ser enviado. A precisão pode diminuir em sotaques fortes, música de fundo ou falantes sobrepostos, onde Pro's larger large-v3 model does better.
Qual a maneira mais rápida de transcrever um podcast ou entrevista longos?
A ferramenta gratuita no navegador funciona e é privada, mas o tempo de processamento varia com o tamanho do arquivo (~15 min para um arquivo de 1 hora em um laptop comum) e é limitado a 60 minutos por arquivo. A opção mais rápida é SnipSound Pro, que processa seu arquivo em GPUs na nuvem em cerca de 1–2 minutos, independentemente do tamanho ou dispositivo, com maior precisão.
Meu navegador ou dispositivo afeta a velocidade da transcrição?
Sim — a ferramenta gratuita funciona no seu próprio hardware. Um navegador com WebGPU (Chrome, Edge ou o Firefox mais recente) funciona na sua GPU e é cerca de duas vezes mais rápido do que um navegador somente CPU, como o Brave (que desativa o WebGPU por padrão). Um arquivo de 16 minutos leva aproximadamente ~4 min com WebGPU, ~8 min em um laptop somente CPU, e até ~18 min em um laptop antigo de núcleo único. Mantenha o laptop conectado para evitar que o modo de economia de bateria limite o desempenho. Pro funciona em GPUs na nuvem na mesma velocidade em qualquer dispositivo (~29 segundos para esse arquivo).
Ele gera timestamps por palavra?
Sim — cada palavra é sincronizada. A transcrição destaca cada palavra karaoke-style enquanto o áudio toca, e você pode clicar em qualquer palavra para pular para aquele momento. Procure uma palavra e ela é marcada na forma de onda. A sincronização é mantida em suas exportações .srt e .vtt.
Posso transformar meu áudio em um vídeo legendado?
Sim — um clique transforma sua transcrição em um vídeo legendado palavra por palavra (texto animado grande) que você pode baixar e compartilhar, ótimo para transformar um trecho de podcast ou nota de voz em um vídeo social sem edição. Ou envie-o diretamente para o Editor de Vídeo com legendas sincronizadas palavra por palavra.
Posso apitar ou censurar uma palavra?
Sim — procure qualquer palavra (um nome, um palavrão, qualquer coisa), bipar cada ocorrência, e baixe o áudio limpo. Raro para uma ferramenta gratuita no navegador. Para um processamento dedicado, veja nosso Removedor de Palavrões.