Free Audio Transcription

IA Gratis Transcripción de Audio & Video

La herramienta de transcripción gratuita de SnipSound convierte audio o video a texto en 99 idiomas, directamente en tu navegador. Convierte una grabación de voz, podcast, entrevista o nota de voz en texto (transcribe audio a texto, voz a texto, convierte audio a texto, sonido a texto). Obtén marcas de tiempo a nivel de palabra con resaltado estilo karaoke, crea un video con subtítulos, silencia cualquier palabra y exporta a .txt, .srt o .vtt. Los archivos nunca salen de tu dispositivo. Sin registro.

¿No tienes un archivo a mano?

Arrastra un archivo de audio o video

o haz clic para buscar.

MP3WAVOGGFLACAACM4AWEBMMP4MOV

¿No tienes un archivo? Graba uno con nuestra grabadora de voz para probar cómo funciona la transcripción.

100% en tu navegador. El audio permanece en tu dispositivo. El modelo de IA Whisper se descarga una vez (~75 MB) de nuestros servidores y luego se ejecuta localmente para cada transcripción. No podemos acceder a tu audio porque nunca sale de tu ordenador. Política de privacidad.

file.mp3
¿En qué idioma está el audio?
Cargando modelo… 0%

Transcript

Opciones de exportación:

¿Cuánto tiempo tardará tu archivo en transcribirse?

La versión gratuita funciona 100% en tu navegador — privada, 0 $, ideal para la mayoría de los archivos. Para archivos largos o máxima precisión, la versión Pro funciona en GPUs en la nube en segundos.

16 min
📁 para rellenar esto automáticamente
● Gratis · en tu navegador
100% privado · $0
◆ Pro · en la nube
Fastest · larger large-v3 model
Detectando tu dispositivo…
Estimates from our own benchmarks (Whisper base in-browser vs large-v3-turbo on cloud GPUs). Free scales with your device; Pro is the same speed on any device.

¿Cuál es el truco de lo gratis?

No hay ninguno oculto — es realmente gratis, ilimitado y privado, porque se ejecuta en tu propio dispositivo en lugar de nuestros servidores, así que no hay nada por lo que cobrar. La única desventaja es time: tu ordenador no es tan rápido como una GPU en la nube, así que la transcripción lleva unos minutos. Para clips cortos, apenas se nota. Para archivos largos la espera se acumula — y ese es el único caso en el que Pro SnipSound Pro se gana su lugar: el mismo trabajo en GPUs en la nube en segundos, con mayor precisión, en cualquier dispositivo.

Gratis vs Pro — tiempos de transcripción típicos

Duración del archivoGratis — en tu navegador*Pro — en la nube
10 min~2–3 min~22 sec
30 min~7–8 min~45 sec
1 hour~15 min~1,5 min
2 hoursdividir primero en partes de ≤60 min~2,5 min

*Free times on a typical laptop with a WebGPU browser (Chrome/Edge); older devices without a GPU can be 2–4× slower. Free is capped at 60 minutes per file. Pro runs on cloud GPUs at the same speed on any device, using the larger large-v3 model for higher accuracy.

¿Qué hace que la transcripción gratuita sea más rápida?

Velocidad por dispositivo & navegador — un archivo de 16 minutos

Tu configuraciónTiempo de transcripción (16 min)
Portátil o teléfono con WebGPU (Chrome, Edge, última versión de Firefox)~4 min
Teléfono, solo CPU (sin WebGPU)~5–6 min
Laptop sin WebGPU (Brave por defecto, navegador antiguo)~8 min
Portátil antiguo, modo de un solo núcleohasta ~18 min
Cualquier dispositivo con Pro (GPU en la nube)~29 sec

Measured on our own benchmarks with the Whisper base model in-browser (large-v3-turbo for Pro). Your exact time varies with your device's chip and the audio itself.

Transcripción de audio & video con IA gratuita y privada — cómo funciona

La herramienta de transcripción de SnipSound utiliza el modelo de código abierto de OpenAI Whisper de reconocimiento de voz que se ejecuta completamente en tu navegador a través de WebAssembly. Arrastra tu audio or o video — para un video, extraemos la pista de audio automáticamente. La primera vez que haces clic Transcribe, tu navegador descarga un archivo de modelo de ~75 MB de nuestros servidores; después de eso, cada transcripción es completamente local. Tu archivo nunca se sube a ningún servidor — ni al nuestro, ni al de OpenAI, ni al de nadie.

¿Trabajas específicamente con video? Prueba Video a texto. ¿Solo necesitas un archivo de subtítulos? El Generador de SRT exporta archivos .srt/.vtt listos para usar.

Para qué sirve

Edita la transcripción — corrige errores, busca y reemplaza

La transcripción automática nunca es perfecta, por eso la transcripción es totalmente editable. Pulsa ✎ Edit y haz clic en cualquier línea para reescribir una palabra mal interpretada — tus cambios se guardan automáticamente y se aplican a cada exportación (.txt, .srt, .vtt y el resto). Usa Find para ir a cada lugar donde aparece una palabra, y Reemplazar todo para corregirla en todas partes a la vez — perfecto para corregir un nombre, marca o término que Whisper transcribió mal (por ejemplo, cada "Mark" → "Marc"). La coincidencia es de palabra completa, así que reemplazar "a" no afectará a la letra "a" dentro de otras palabras. ¿Prefieres la transcripción sin editar? Cambia entre las Original and Edited pestañas en cualquier momento — el original sin tocar se guarda con el archivo.

Para qué no es tan bueno

Traducir audio a inglés

Marca la casilla "Traducir a inglés" y Whisper convierte cualquier audio que no esté en inglés en texto en inglés. Pódcast en español → transcripción en inglés. Entrevista en mandarín → notas en inglés. Herramienta de traducción de audio dedicada aquí si la traducción es tu necesidad principal.

Transcribir vídeo a texto

También puedes transcribir vídeo a texto: sube un MP4, MOV, WebM o MKV y se extrae la pista de audio automáticamente antes de transcribirla. No necesitas convertir el vídeo a audio por tu cuenta.

Funciona igual que con un archivo de audio — todo ocurre en tu navegador, así que el vídeo nunca se sube a un servidor. Es útil para entrevistas, clases grabadas, pódcast en vídeo y reuniones.

Transcribe audio en 99 idiomas

SnipSound transcribe voz en 99 idiomas, con un selector de idiomas con búsqueda y detección automática de idioma real — realiza una auténtica identificación de idioma, algo que la mayoría de las herramientas en el navegador no pueden hacer. Con voz clara, la precisión es alta en los principales idiomas, incluyendo inglés, español, francés, portugués, italiano, alemán, ruso, chino y japonés — por lo que maneja "transcribir audio a texto", "transcrire audio en texte", "trascrizione audio", "音声文字起こし" y más, directamente en tu navegador.

Un par de aclaraciones para que sepas qué esperar: las cifras de precisión son para clear el habla —los acentos marcados o el audio ruidoso reducen la precisión en cualquier modelo local— y algunos idiomas con menos recursos (entre ellos el hindi/urdu) son menos precisos en el modelo gratuito, por eso el selector de idioma los marca con un nivel de precisión limitado; para esos idiomas, el modelo Pro funciona mejor. Para el chino y el japonés, la transcripción y los subtítulos son excelentes; la precisión de clic palabra por palabra es mayor en los idiomas con escritura latina. Se están implementando páginas localizadas para los idiomas principales, o simplemente abre la herramienta y elige tu idioma (o deja que la detección automática lo haga).

Más que una transcripción

Más allá de convertir audio a texto, la misma herramienta gratuita lee archivos largos en voz alta mientras los transcribe (resultados en tiempo real), te permite editar una palabra manteniendo su sincronización exacta en los subtítulos, muestra un most-said-words análisis, y encuentra y reproduce cada instancia de una palabra. Cuando termines, un clic envía tu video más la transcripción sincronizada palabra por palabra directamente al editor de video gratuito editor de video con los subtítulos ya en la línea de tiempo —y al volver a abrir un archivo más tarde, su transcripción se restaura al instante.

Modo de revisión es lo más destacado: la IA subraya cualquier palabra de la que no estuviera completamente segura, y un botón de Revisión te guía por cada una de ellas, reproduciendo solo el audio de esa palabra para que puedas mantenerla o corregirla con un toque —y tus decisiones se guardan. Hay más: Filtros de búsqueda la transcripción para mostrar frases coincidentes y resalta dónde se encuentran en la forma de onda, buscar & reemplazar todo corrige un nombre mal escuchado en todas partes a la vez (se mantienen las sincronizaciones), las ediciones auto-save se restauran al volver a subir el archivo, el video con subtítulos coincide con la relación de aspecto de tu fuente y tiene sus propios controles de reproducción, y hay una vista de transcripción a pantalla completa con marcas de tiempo a nivel de oración.

SnipSound vs. Otter.ai, Rev & Descript

La gente suele comparar SnipSound con transcriptores de pago en la nube como Otter.ai, Rev and Descript. La diferencia principal: ellos suben tu audio a sus servidores y cobran una suscripción mensual o una tarifa por minuto, mientras que SnipSound funciona gratis en tu navegador sin subir nada — solo el nivel Pro opcional tiene costo, y es de pago por uso sin suscripción.

FeatureSnipSoundOtter.aiRevDescript
CostGratis — Pro es de pago por uso, sin suscripciónFreemium, de pago mensualPago por minuto / suscripciónPago mensual
Tu audioPermanece en tu navegador — nunca se subeSubido a sus servidoresUploadedUploaded
Cuenta necesariaNoneRequiredRequiredRequired
Idiomas (soporte de modelos)99FewerFewerFewer
Marcas de tiempo a nivel de palabraYesYesYesYes
Crear un video con subtítulosSí, integradoNoNoSí (de pago)
Límite gratuito por archivo60 min, archivos ilimitadosMinutos gratis limitadosSolo pruebaGratuito limitado

Una alternativa gratuita y privada alternativa a Otter.ai para cualquiera que no quiera su audio en un servidor de terceros. Para audios complejos, SnipSound Pro ejecuta el modelo más grande en GPUs en la nube, de pago por uso.

¿Qué tan preciso es y cuándo merece la pena Pro?

En audio limpio, de un solo hablante, el modelo gratuito en el navegador (Whisper base de OpenAI) es muy preciso. En nuestras propias pruebas, el inglés y el español obtuvieron alrededor del 100%, el chino y el japonés ~100% de precisión en el contenido, y el francés alrededor del 88%. En una prueba de referencia estándar de voz limpia, esto es aproximadamente 95%; the Pro model (Whisper large-v3) is around 98%. El audio real con ruido de fondo, música, acentos fuertes o hablantes superpuestos es más difícil para cualquier modelo, por lo que la precisión es menor; nunca afirmamos un 99%.

Con qué tiene dificultades el modelo gratuito (y dónde Pro ayuda)

Idioma (voz limpia)Modelo gratuito en el navegador
Inglés, español~100%
Chino, japonés~100% de precisión en el contenido
French~88%
HindiSincronización de palabras precisa; texto más débil en la versión gratuita — usa Pro

Los subtítulos sincronizados palabra por palabra se verificaron en inglés, español, francés, hindi, chino y japonés (incluidas escrituras no latinas) — cada palabra sincronizada, 98–100% de cobertura de audio. "99 idiomas" se refiere al soporte de idiomas del modelo; la precisión varía según el idioma y la calidad del audio, y la versión gratuita es ~95% / Pro ~98% en voz limpia.

Preguntas frecuentes

¿Es realmente gratis?
Sí. Sin cuenta, sin tarjeta, sin límites de uso. La transcripción se realiza en tu navegador usando el modelo de código abierto Whisper de OpenAI.
¿Mi audio se sube a algún sitio?
No. Tu archivo de audio permanece en tu navegador. El modelo de IA se descarga de nuestros servidores una vez y se guarda en caché localmente; después de eso, la transcripción es completamente offline.
¿Qué idiomas soporta?
99 idiomas, incluyendo inglés, español, mandarín, hindi, árabe, francés, portugués, ruso, japonés, alemán, coreano, italiano y muchos más. La detección automática elige entre los primeros segundos.
¿Puede traducir audio al inglés?
Sí. Marca la casilla "Traducir a inglés" y Whisper convertirá cualquier audio que no esté en inglés a texto en inglés. O usa el dedicado Traductor de Audio.
¿Qué tan precisa es la transcripción?
Muy bueno para voz clara en 99 idiomas. La precisión puede disminuir con acentos marcados, música de fondo, oradores superpuestos o audio ruidoso, porque la herramienta gratuita ejecuta un modelo más ligero en tu navegador. Para el audio más difícil, SnipSound Pro ejecuta el modelo grande superior en GPUs en la nube para la máxima precisión — pago por uso, sin suscripción mensual — y aún puedes editar el resultado. De cualquier manera, la herramienta gratuita nunca sube tu archivo.
¿Cómo se compara esto con Otter, Rev o Descript?
Son servicios de pago en la nube (aproximadamente $10–30/mes) que suben tu audio a sus servidores. SnipSound transcribe gratis, directamente en tu navegador — no se sube nada, sin cuenta, sin tarifa mensual, sin límite de tiempo por archivo. Cuando necesitas la máxima precisión en audio difícil, SnipSound Pro ejecuta el modelo más grande en la nube bajo un modelo de pago por uso en lugar de una suscripción.
¿Puedo transcribir un video de YouTube?
Sí. Descarga el video de YouTube (o solo su audio) y arrastra el archivo aquí — lo transcribimos localmente en tu navegador y puedes exportar subtítulos .srt/.vtt. No extraemos directamente de enlaces de YouTube, que es precisamente lo que mantiene tus datos privados.
¿Puedo editar la transcripción?
Sí — haz clic en ✎ Edit y reescribe cualquier línea, o usa Buscar & reemplazar todo para corregir una palabra en todas partes a la vez. Las ediciones se aplican a todas las exportaciones (.txt, .srt, .vtt). La mayoría de los transcribidores gratuitos son de solo lectura.
¿Puedo obtener subtítulos para un video?
Sí — descarga .srt o .vtt con marcas de tiempo. Funciona en YouTube, Vimeo, la mayoría de los editores de video. Arrastra tu archivo de video directamente aquí — extraemos el audio automáticamente.
¿Hay un límite de duración?
60 minutos por archivo. Los archivos más largos usan demasiada RAM del navegador. Recorta con nuestro Recortador de Audio o divide con el Divisor de Audio first.
¿Cuánto tiempo tarda en transcribir un archivo de audio de 1 hora?
En tu navegador, unos 15 minutos en un portátil típico con un navegador WebGPU — gratis, privado, usando el modelo base de Whisper. Los dispositivos más antiguos sin GPU pueden ser más lentos. Con SnipSound Pro on cloud GPUs it's roughly 1.5 minutes, the same speed on any device, using the larger large-v3 model. (Measured on whisper-base in-browser vs whisper-large-v3-turbo on cloud GPUs.)
¿Es precisa la transcripción gratuita basada en navegador?
Sí — muy bueno para voz clara en 99 idiomas, ejecutando el modelo base de Whisper directamente en tu dispositivo sin subir nada. La precisión puede disminuir con acentos marcados, música de fondo o oradores superpuestos, donde Pro's larger large-v3 model does better.
¿Cuál es la forma más rápida de transcribir un podcast o una entrevista largos?
La herramienta gratuita en el navegador funciona y se mantiene privada, pero su tiempo escala con la duración (aprox. 15 min para un archivo de 1 hora en un portátil típico) y está limitada a 60 minutos por archivo. La opción más rápida es SnipSound Pro, que procesa tu archivo en GPUs en la nube en aproximadamente 1–2 minutos, independientemente de la duración o el dispositivo, con mayor precisión.
¿Mi navegador o dispositivo afectan la velocidad de transcripción?
Sí — la herramienta gratuita funciona en tu propio hardware. Un navegador con WebGPU (Chrome, Edge o la última versión de Firefox) funciona con tu GPU y es aproximadamente el doble de rápido que un navegador solo con CPU como Brave (que desactiva WebGPU por defecto). Un archivo de 16 minutos tarda aproximadamente ~4 min con WebGPU, ~8 min en un portátil solo con CPU, y hasta ~18 min en un equipo antiguo de un solo núcleo. Mantén el portátil enchufado para evitar la limitación de rendimiento por ahorro de batería. Pro funciona con GPU en la nube a la misma velocidad en cualquier dispositivo (~29 segundos para ese archivo).
¿Ofrece marcas de tiempo a nivel de palabra?
Sí — cada palabra está sincronizada. La transcripción resalta cada palabra karaoke-style mientras se reproduce el audio, y puedes hacer clic en cualquier palabra para saltar a ese momento. Busca una palabra y aparecerá marcada en la forma de onda. La sincronización se mantiene en tus exportaciones .srt y .vtt.
¿Puedo convertir mi audio en un video con subtítulos?
Sí — un clic convierte tu transcripción en un video subtitulado palabra por palabra (texto animado grande) que puedes descargar y compartir, ideal para convertir un fragmento de podcast o una nota de voz en un video para redes sociales sin edición. O envíalo directamente al Editor de Video con subtítulos sincronizados palabra por palabra.
¿Puedo censurar o silenciar una palabra?
Sí — busca cualquier palabra (un nombre, una palabrota, lo que sea), censura cada aparición, y descarga el audio limpio. Poco común para una herramienta gratuita en el navegador. Para un procesamiento dedicado, consulta nuestro Eliminador de groserías.