IA Gratis Transcripción de Audio & Video
La herramienta de transcripción gratuita de SnipSound convierte audio o video a texto en 99 idiomas, directamente en tu navegador. Convierte una grabación de voz, podcast, entrevista o nota de voz en texto (transcribe audio a texto, voz a texto, convierte audio a texto, sonido a texto). Obtén marcas de tiempo a nivel de palabra con resaltado estilo karaoke, crea un video con subtítulos, silencia cualquier palabra y exporta a .txt, .srt o .vtt. Los archivos nunca salen de tu dispositivo. Sin registro.
Arrastra un archivo de audio o video
o haz clic para buscar.
¿No tienes un archivo? Graba uno con nuestra grabadora de voz para probar cómo funciona la transcripción.
100% en tu navegador. El audio permanece en tu dispositivo. El modelo de IA Whisper se descarga una vez (~75 MB) de nuestros servidores y luego se ejecuta localmente para cada transcripción. No podemos acceder a tu audio porque nunca sale de tu ordenador. Política de privacidad.
Transcript
¿Cuánto tiempo tardará tu archivo en transcribirse?
La versión gratuita funciona 100% en tu navegador — privada, 0 $, ideal para la mayoría de los archivos. Para archivos largos o máxima precisión, la versión Pro funciona en GPUs en la nube en segundos.
¿Cuál es el truco de lo gratis?
No hay ninguno oculto — es realmente gratis, ilimitado y privado, porque se ejecuta en tu propio dispositivo en lugar de nuestros servidores, así que no hay nada por lo que cobrar. La única desventaja es time: tu ordenador no es tan rápido como una GPU en la nube, así que la transcripción lleva unos minutos. Para clips cortos, apenas se nota. Para archivos largos la espera se acumula — y ese es el único caso en el que Pro SnipSound Pro se gana su lugar: el mismo trabajo en GPUs en la nube en segundos, con mayor precisión, en cualquier dispositivo.
Gratis vs Pro — tiempos de transcripción típicos
| Duración del archivo | Gratis — en tu navegador* | Pro — en la nube |
|---|---|---|
| 10 min | ~2–3 min | ~22 sec |
| 30 min | ~7–8 min | ~45 sec |
| 1 hour | ~15 min | ~1,5 min |
| 2 hours | dividir primero en partes de ≤60 min | ~2,5 min |
*Free times on a typical laptop with a WebGPU browser (Chrome/Edge); older devices without a GPU can be 2–4× slower. Free is capped at 60 minutes per file. Pro runs on cloud GPUs at the same speed on any device, using the larger large-v3 model for higher accuracy.
¿Qué hace que la transcripción gratuita sea más rápida?
- Usa un navegador con WebGPU — Chrome o Edge (y la última versión de Firefox) lo ejecutan en tu GPU, aproximadamente 2 veces más rápido que un navegador que solo usa la CPU. Brave deshabilita WebGPU por defecto.
- Mantén tu portátil conectado — el modo de ahorro de batería ralentiza tu CPU/GPU y puede casi duplicar el tiempo.
- Cierra otras pestañas y aplicaciones pesadas — la transcripción usa tu CPU/GPU y memoria; libéralas.
- Un dispositivo con GPU es mucho más rápido — un teléfono o portátil reciente con WebGPU supera con creces a una máquina antigua que solo usa la CPU (un teléfono moderno puede incluso superar a un portátil sin GPU).
- La primera vez se descarga el modelo una sola vez — una espera única; cada transcripción posterior la omite.
Velocidad por dispositivo & navegador — un archivo de 16 minutos
| Tu configuración | Tiempo de transcripción (16 min) |
|---|---|
| Portátil o teléfono con WebGPU (Chrome, Edge, última versión de Firefox) | ~4 min |
| Teléfono, solo CPU (sin WebGPU) | ~5–6 min |
| Laptop sin WebGPU (Brave por defecto, navegador antiguo) | ~8 min |
| Portátil antiguo, modo de un solo núcleo | hasta ~18 min |
| Cualquier dispositivo con Pro (GPU en la nube) | ~29 sec |
Measured on our own benchmarks with the Whisper base model in-browser (large-v3-turbo for Pro). Your exact time varies with your device's chip and the audio itself.
Transcripción de audio & video con IA gratuita y privada — cómo funciona
La herramienta de transcripción de SnipSound utiliza el modelo de código abierto de OpenAI Whisper de reconocimiento de voz que se ejecuta completamente en tu navegador a través de WebAssembly. Arrastra tu audio or o video — para un video, extraemos la pista de audio automáticamente. La primera vez que haces clic Transcribe, tu navegador descarga un archivo de modelo de ~75 MB de nuestros servidores; después de eso, cada transcripción es completamente local. Tu archivo nunca se sube a ningún servidor — ni al nuestro, ni al de OpenAI, ni al de nadie.
¿Trabajas específicamente con video? Prueba Video a texto. ¿Solo necesitas un archivo de subtítulos? El Generador de SRT exporta archivos .srt/.vtt listos para usar.
Para qué sirve
- Transcribir entrevistas de podcast, grabaciones de reuniones, notas de voz, conferencias o cualquier audio con voz clara.
- Añadir subtítulos a un video — genera subtítulos automáticos como descargas .srt y .vtt con marcas de tiempo precisas que puedes usar en YouTube, Vimeo o cualquier editor.
- Una alternativa gratuita y privada a Otter, Rev y Descript para periodistas, investigadores, estudiantes y creadores — sin suscripción, sin subidas, sin límite de tiempo por archivo.
- Audio sensible a la privacidad que no quieres en un servidor de terceros — notas de terapia, entrevistas confidenciales, reuniones internas.
- Marcas de tiempo a nivel de palabra — resaltado de palabras tipo karaoke y clic para saltar, para que puedas extraer una cita exacta o crear subtítulos precisos.
- Convertir audio en video subtitulado — video con subtítulos palabra por palabra con un solo clic para podcasts, notas de voz y clips sociales, descargable y compartible.
- Censurar palabras — busca cualquier palabra y silencia todas sus apariciones, luego descarga el audio limpio (funciona con nuestro Eliminador de groserías).
Edita la transcripción — corrige errores, busca y reemplaza
La transcripción automática nunca es perfecta, por eso la transcripción es totalmente editable. Pulsa ✎ Edit y haz clic en cualquier línea para reescribir una palabra mal interpretada — tus cambios se guardan automáticamente y se aplican a cada exportación (.txt, .srt, .vtt y el resto). Usa Find para ir a cada lugar donde aparece una palabra, y Reemplazar todo para corregirla en todas partes a la vez — perfecto para corregir un nombre, marca o término que Whisper transcribió mal (por ejemplo, cada "Mark" → "Marc"). La coincidencia es de palabra completa, así que reemplazar "a" no afectará a la letra "a" dentro de otras palabras. ¿Prefieres la transcripción sin editar? Cambia entre las Original and Edited pestañas en cualquier momento — el original sin tocar se guarda con el archivo.
Para qué no es tan bueno
- Ruido de fondo intenso, música de fondo con voz o múltiples oradores superpuestos — el pequeño Whisper tiene dificultades con esto.
- Acentos marcados o dialectos poco comunes — los modelos más grandes de Whisper los manejan mejor, pero son demasiado pesados para un navegador.
- Diarización de oradores ("quién dijo qué") — no compatible con Whisper-tiny.
- Archivos de más de 60 minutos — limitamos la duración de la entrada para mantener el consumo de RAM del navegador bajo control.
Traducir audio a inglés
Marca la casilla "Traducir a inglés" y Whisper convierte cualquier audio que no esté en inglés en texto en inglés. Pódcast en español → transcripción en inglés. Entrevista en mandarín → notas en inglés. Herramienta de traducción de audio dedicada aquí si la traducción es tu necesidad principal.
Transcribir vídeo a texto
También puedes transcribir vídeo a texto: sube un MP4, MOV, WebM o MKV y se extrae la pista de audio automáticamente antes de transcribirla. No necesitas convertir el vídeo a audio por tu cuenta.
Funciona igual que con un archivo de audio — todo ocurre en tu navegador, así que el vídeo nunca se sube a un servidor. Es útil para entrevistas, clases grabadas, pódcast en vídeo y reuniones.
Transcribe audio en 99 idiomas
SnipSound transcribe voz en 99 idiomas, con un selector de idiomas con búsqueda y detección automática de idioma real — realiza una auténtica identificación de idioma, algo que la mayoría de las herramientas en el navegador no pueden hacer. Con voz clara, la precisión es alta en los principales idiomas, incluyendo inglés, español, francés, portugués, italiano, alemán, ruso, chino y japonés — por lo que maneja "transcribir audio a texto", "transcrire audio en texte", "trascrizione audio", "音声文字起こし" y más, directamente en tu navegador.
Un par de aclaraciones para que sepas qué esperar: las cifras de precisión son para clear el habla —los acentos marcados o el audio ruidoso reducen la precisión en cualquier modelo local— y algunos idiomas con menos recursos (entre ellos el hindi/urdu) son menos precisos en el modelo gratuito, por eso el selector de idioma los marca con un nivel de precisión limitado; para esos idiomas, el modelo Pro funciona mejor. Para el chino y el japonés, la transcripción y los subtítulos son excelentes; la precisión de clic palabra por palabra es mayor en los idiomas con escritura latina. Se están implementando páginas localizadas para los idiomas principales, o simplemente abre la herramienta y elige tu idioma (o deja que la detección automática lo haga).
Más que una transcripción
Más allá de convertir audio a texto, la misma herramienta gratuita lee archivos largos en voz alta mientras los transcribe (resultados en tiempo real), te permite editar una palabra manteniendo su sincronización exacta en los subtítulos, muestra un most-said-words análisis, y encuentra y reproduce cada instancia de una palabra. Cuando termines, un clic envía tu video más la transcripción sincronizada palabra por palabra directamente al editor de video gratuito editor de video con los subtítulos ya en la línea de tiempo —y al volver a abrir un archivo más tarde, su transcripción se restaura al instante.
Modo de revisión es lo más destacado: la IA subraya cualquier palabra de la que no estuviera completamente segura, y un botón de Revisión te guía por cada una de ellas, reproduciendo solo el audio de esa palabra para que puedas mantenerla o corregirla con un toque —y tus decisiones se guardan. Hay más: Filtros de búsqueda la transcripción para mostrar frases coincidentes y resalta dónde se encuentran en la forma de onda, buscar & reemplazar todo corrige un nombre mal escuchado en todas partes a la vez (se mantienen las sincronizaciones), las ediciones auto-save se restauran al volver a subir el archivo, el video con subtítulos coincide con la relación de aspecto de tu fuente y tiene sus propios controles de reproducción, y hay una vista de transcripción a pantalla completa con marcas de tiempo a nivel de oración.
SnipSound vs. Otter.ai, Rev & Descript
La gente suele comparar SnipSound con transcriptores de pago en la nube como Otter.ai, Rev and Descript. La diferencia principal: ellos suben tu audio a sus servidores y cobran una suscripción mensual o una tarifa por minuto, mientras que SnipSound funciona gratis en tu navegador sin subir nada — solo el nivel Pro opcional tiene costo, y es de pago por uso sin suscripción.
| Feature | SnipSound | Otter.ai | Rev | Descript |
|---|---|---|---|---|
| Cost | Gratis — Pro es de pago por uso, sin suscripción | Freemium, de pago mensual | Pago por minuto / suscripción | Pago mensual |
| Tu audio | Permanece en tu navegador — nunca se sube | Subido a sus servidores | Uploaded | Uploaded |
| Cuenta necesaria | None | Required | Required | Required |
| Idiomas (soporte de modelos) | 99 | Fewer | Fewer | Fewer |
| Marcas de tiempo a nivel de palabra | Yes | Yes | Yes | Yes |
| Crear un video con subtítulos | Sí, integrado | No | No | Sí (de pago) |
| Límite gratuito por archivo | 60 min, archivos ilimitados | Minutos gratis limitados | Solo prueba | Gratuito limitado |
Una alternativa gratuita y privada alternativa a Otter.ai para cualquiera que no quiera su audio en un servidor de terceros. Para audios complejos, SnipSound Pro ejecuta el modelo más grande en GPUs en la nube, de pago por uso.
¿Qué tan preciso es y cuándo merece la pena Pro?
En audio limpio, de un solo hablante, el modelo gratuito en el navegador (Whisper base de OpenAI) es muy preciso. En nuestras propias pruebas, el inglés y el español obtuvieron alrededor del 100%, el chino y el japonés ~100% de precisión en el contenido, y el francés alrededor del 88%. En una prueba de referencia estándar de voz limpia, esto es aproximadamente 95%; the Pro model (Whisper large-v3) is around 98%. El audio real con ruido de fondo, música, acentos fuertes o hablantes superpuestos es más difícil para cualquier modelo, por lo que la precisión es menor; nunca afirmamos un 99%.
Con qué tiene dificultades el modelo gratuito (y dónde Pro ayuda)
- Acentos fuertes, nombres propios, jerga y acrónimos — el modelo gratuito más pequeño malinterpreta las palabras raras con más frecuencia; el modelo más grande de Pro las acierta la mayoría de las veces.
- Música o ruido de fondo bajo la voz, y hablantes superpuestos — ambos son difíciles para un modelo del tamaño de un navegador, y ninguno de los modelos etiqueta quién dijo qué.
- Algunos idiomas. El modelo gratuito es excelente para los principales idiomas europeos, además del chino y el japonés, pero más débil en otros. Por ejemplo, Hindi en el modelo gratuito puede aparecer en la escritura urdu relacionada con desviación fonética — el hindi y el urdu son el mismo idioma hablado, y esta es una limitación conocida del modelo más pequeño. La sincronización de palabras se mantiene precisa; es el texto el que sufre. El modelo más grande de Pro maneja el hindi y otros idiomas más difíciles mucho mejor.
| Idioma (voz limpia) | Modelo gratuito en el navegador |
|---|---|
| Inglés, español | ~100% |
| Chino, japonés | ~100% de precisión en el contenido |
| French | ~88% |
| Hindi | Sincronización de palabras precisa; texto más débil en la versión gratuita — usa Pro |
Los subtítulos sincronizados palabra por palabra se verificaron en inglés, español, francés, hindi, chino y japonés (incluidas escrituras no latinas) — cada palabra sincronizada, 98–100% de cobertura de audio. "99 idiomas" se refiere al soporte de idiomas del modelo; la precisión varía según el idioma y la calidad del audio, y la versión gratuita es ~95% / Pro ~98% en voz limpia.