Free Audio Transcription

IA gratuite Transcription audio & vidéo

L'outil de transcription gratuit de SnipSound transforme l'audio ou la vidéo en texte dans 99 langues, directement dans votre navigateur. Transformez un enregistrement vocal, un podcast, une interview ou un mémo vocal en texte (transcrire l'audio en texte, voix en texte, convertir l'audio en texte, son en texte). Obtenez des horodatages mot par mot avec surlignage façon karaoké, créez une vidéo sous-titrée, censurez n'importe quel mot, et exportez aux formats .txt, .srt ou .vtt. Vos fichiers restent sur votre appareil. Sans inscription.

Pas de fichier sous la main ?

Déposez un fichier audio ou vidéo

ou cliquez pour parcourir.

MP3WAVOGGFLACAACM4AWEBMMP4MOV

Vous n'avez pas de fichier ? Enregistrez-en un avec notre enregistreur vocal pour tester le fonctionnement de la transcription.

100 % dans votre navigateur. L'audio reste sur votre appareil. Le modèle IA Whisper se télécharge une seule fois (~75 Mo) depuis nos serveurs, puis fonctionne localement pour chaque transcription. Nous n'avons pas accès à votre audio car il ne quitte jamais votre ordinateur. Politique de confidentialité.

file.mp3
Dans quelle langue est l'audio ?
Chargement du modèle… 0%

Transcript

Options d'exportation :

Combien de temps prendra la transcription de votre fichier ?

La version gratuite tourne à 100 % dans votre navigateur — privée, 0 $, idéale pour la plupart des fichiers. Pour un fichier long ou une précision maximale, la version Pro tourne sur des GPU cloud en quelques secondes.

16 min
📁 pour le remplir automatiquement
● Gratuit · dans votre navigateur
100 % privé · 0 $
◆ Pro · Cloud
Fastest · larger large-v3 model
Détection de votre appareil…
Estimates from our own benchmarks (Whisper base in-browser vs large-v3-turbo on cloud GPUs). Free scales with your device; Pro is the same speed on any device.

Quel est le piège du gratuit ?

Il n'y en a pas de caché — c'est vraiment gratuit, illimité et privé, car il fonctionne sur votre appareil plutôt que sur nos serveurs, donc nous n'avons rien à facturer. La seule contrepartie est time: votre ordinateur n'est pas aussi rapide qu'un GPU cloud, donc la transcription prend quelques minutes. Pour les clips courts, c'est à peine perceptible. Pour les fichiers longs l'attente s'accumule — et c'est là que Pro prend tout son sens : le même travail sur des GPU cloud en quelques secondes, avec une précision supérieure, sur n'importe quel appareil.

Gratuit vs Pro — durées de transcription habituelles

Durée du fichierGratuit — dans votre navigateur*Pro — Cloud
10 min~2–3 min~22 sec
30 minenviron 7–8 min~45 sec
1 hour~15 min~1,5 min
2 hoursà diviser d'abord en parties de ≤60 min~2,5 min

*Free times on a typical laptop with a WebGPU browser (Chrome/Edge); older devices without a GPU can be 2–4× slower. Free is capped at 60 minutes per file. Pro runs on cloud GPUs at the same speed on any device, using the larger large-v3 model for higher accuracy.

Qu'est-ce qui rend la transcription gratuite plus rapide ?

Vitesse par appareil & navigateur — un fichier de 16 minutes

Votre configurationTemps de transcription (16 min)
Ordinateur portable ou téléphone avec WebGPU (Chrome, Edge, Firefox récent)~4 min
Téléphone, CPU uniquement (sans WebGPU)environ 5–6 min
Laptop sans WebGPU (Brave par défaut, navigateur plus ancien)~8 min
Vieil ordinateur portable, mode monocœurjusqu'à ~18 min
N'importe quel appareil avec Pro (GPU cloud)~29 sec

Measured on our own benchmarks with the Whisper base model in-browser (large-v3-turbo for Pro). Your exact time varies with your device's chip and the audio itself.

Transcription audio & vidéo IA gratuite et privée — comment ça marche

L'outil de transcription de SnipSound utilise le modèle open-source d'OpenAI Whisper de reconnaissance vocale qui s'exécute entièrement dans votre navigateur via WebAssembly. Déposez un fichier audio or Vidéo — pour une vidéo, nous extrayons automatiquement la piste audio. La première fois que vous cliquez Transcribe, votre navigateur télécharge un fichier modèle d'environ 75 Mo depuis nos serveurs ; après cela, chaque transcription est entièrement locale. Votre fichier n'est jamais envoyé sur aucun serveur — ni le nôtre, ni celui d'OpenAI, ni celui de quiconque.

Pour la vidéo spécifiquement ? Essayez Vidéo vers Texte. Vous avez juste besoin d'un fichier de sous-titres ? Le Générateur SRT exporte des fichiers .srt/.vtt prêts à l'emploi.

À quoi ça sert

Modifier la transcription — corriger les erreurs, rechercher & remplacer

L'auto-transcription n'est jamais parfaite, la transcription est donc entièrement modifiable. Cliquez sur ✎ Edit et cliquez sur n'importe quelle ligne pour retaper un mot mal entendu — vos modifications sont enregistrées automatiquement et se répercutent sur toutes les exportations (.txt, .srt, .vtt, et les autres). Utilisez Find pour accéder à chaque occurrence d'un mot, et Tout remplacer pour le corriger partout en une seule fois — parfait pour corriger un nom, une marque ou un terme que Whisper a mal orthographié (par exemple, chaque "Mark" → "Marc"). La correspondance est par mot entier, donc remplacer "a" ne modifiera pas la lettre "a" à l'intérieur d'autres mots. Vous préférez la sortie brute ? Basculez entre les Original and Edited onglets à tout moment — l'original non modifié reste enregistré avec le fichier.

Ce pour quoi ce n'est pas idéal

Traduire l'audio en anglais

Cochez "Translate to English" et Whisper convertit tout audio non-anglais en texte anglais. Podcast espagnol → transcription anglaise. Interview en mandarin → notes en anglais. Outil de traduction audio dédié ici si la traduction est votre besoin principal.

Transcrire l'audio en 99 langues

SnipSound transcrit la parole en 99 langues, avec un sélecteur de langue consultable et une véritable détection automatique de la langue — il effectue une véritable identification de la langue, ce que la plupart des outils en ligne ne peuvent pas faire. Sur une parole claire, la précision est élevée pour les langues principales, notamment l'anglais, l'espagnol, le français, le portugais, l'italien, l'allemand, le russe, le chinois et le japonais — il gère donc "transcribir audio a texto", "transcrire audio en texte", "trascrizione audio", "音声文字起こし" et plus encore, directement dans votre navigateur.

Quelques remarques honnêtes pour que vous sachiez à quoi vous attendre : les chiffres de précision concernent clear la parole — les accents prononcés ou l'audio bruyant réduisent la précision sur tout modèle embarqué — et quelques langues à faibles ressources (l'hindi/ourdou parmi elles) sont moins performantes sur le modèle gratuit, c'est pourquoi le sélecteur de langue indique un niveau de précision limité pour celles-ci ; pour celles-ci, le modèle Pro est plus performant. Pour le chinois et le japonais, la transcription et les sous-titres sont excellents ; la précision du clic mot par mot est la plus forte sur les langues à écriture latine. Des pages localisées pour les langues principales sont en cours de déploiement — ou ouvrez simplement l'outil et choisissez votre langue (ou laissez la détection automatique le faire).

Plus qu'une transcription

Au-delà de la conversion parole-texte, le même outil gratuit lit les fichiers longs à voix haute pendant qu'ils sont transcrits en direct), vous permet de modifier un mot tout en conservant son minutage exact dans les sous-titres, affiche une most-said-words analyse, et trouve et lit chaque occurrence d'un mot. Une fois terminé, un clic envoie votre vidéo et la transcription minutée mot par mot directement vers l'éditeur vidéo gratuit éditeur vidéo avec les sous-titres déjà sur la timeline — et rouvrir un fichier plus tard restaure sa transcription instantanément.

Mode révision ce qui le distingue : l'IA souligne chaque mot dont elle n'était pas entièrement sûre, et un bouton 'Réviser' vous guide à travers chacun d'eux. rejouant uniquement l'audio de ce mot afin que vous puissiez le conserver ou le corriger d'un simple toucher — et vos décisions sont enregistrées. Ce n'est pas tout : Filtres de recherche la transcription pour trouver les phrases correspondantes et les met en évidence sur la forme d'onde, rechercher & remplacer tout corrige un nom mal entendu partout en une seule fois (minutage conservé), les modifications auto-save et la restauration lors du re-téléchargement, la vidéo sous-titrée correspond au rapport d'aspect de votre source avec ses propres commandes de lecture, et il y a une vue plein écran de la transcription avec des horodatages au niveau des phrases.

SnipSound contre Otter.ai, Rev & Descript

Les gens comparent généralement SnipSound à des transcripteurs cloud payants comme Otter.ai, Rev and Descript. La différence fondamentale : ceux-ci téléchargent votre audio sur leurs serveurs et facturent un abonnement mensuel ou des frais par minute, tandis que SnipSound fonctionne gratuitement dans votre navigateur sans rien télécharger — seul le niveau Pro optionnel est payant, et il s'agit d'un paiement à l'utilisation sans abonnement.

FeatureSnipSoundOtter.aiRevDescript
CostGratuit — Pro est payant à l'utilisation, sans abonnementFreemium, payant mensuellementPayant à la minute / abonnementPayant mensuellement
Votre audioReste dans votre navigateur — jamais envoyéEnvoyé sur leurs serveursUploadedUploaded
Compte requisNoneRequiredRequiredRequired
Langues (prise en charge)99FewerFewerFewer
Horodatage au mot prèsYesYesYesYes
Créer une vidéo sous-titréeOui, intégréNoNoOui (payant)
Limite gratuite par fichier60 min, fichiers illimitésMinutes gratuites limitéesEssai uniquementGratuit limité

Une alternative gratuite et privée alternative à Otter.ai pour quiconque ne souhaite pas que son audio soit hébergé sur un serveur tiers. Pour les audios les plus complexes, SnipSound Pro utilise le modèle le plus puissant sur des GPU cloud, facturation à l'usage.

Quelle est sa précision — et quand le Pro est-il intéressant ?

Pour un audio clair, avec un seul locuteur, le modèle gratuit intégré au navigateur (Whisper base d'OpenAI) est très précis. Lors de nos tests, l'anglais et l'espagnol ont atteint environ 100 %, le chinois et le japonais environ 100 % de précision de contenu, et le français environ 88 %. Sur un benchmark standard de parole claire, cela représente environ 95%; the Pro model (Whisper large-v3) is around 98%. Les audios réels avec du bruit de fond, de la musique, des accents prononcés ou des locuteurs qui se chevauchent sont plus difficiles pour n'importe quel modèle, la précision est donc plus faible — nous ne prétendons jamais atteindre 99 %.

Ce qui pose problème au modèle gratuit (et où le Pro intervient)

Langue (discours clair)Modèle gratuit intégré au navigateur
Anglais, Espagnol~100%
Chinois, JaponaisContenu précis à ~100 %
French~88%
HindiCalage des mots précis ; texte moins fiable sur le modèle gratuit — utiliser Pro

Les sous-titres synchronisés mot par mot ont été vérifiés en anglais, espagnol, français, hindi, chinois et japonais (y compris les écritures non latines) — chaque mot est calé, couverture audio de 98 à 100 %. « 99 langues » fait référence à la prise en charge linguistique du modèle ; la précision varie selon la langue et la qualité audio, et le modèle gratuit est à ~95 % / le modèle Pro à ~98 % sur un discours clair.

Questions fréquentes

Est-ce vraiment gratuit ?
Oui. Pas de compte, pas de carte, pas de limites d'utilisation. La transcription s'effectue dans votre navigateur en utilisant le modèle open-source Whisper d'OpenAI.
Mon audio est-il téléchargé quelque part ?
Non. Votre fichier audio reste dans votre navigateur. Le modèle d'IA est téléchargé une seule fois depuis nos serveurs et mis en cache localement — après cela, la transcription est entièrement hors ligne.
Quelles langues sont prises en charge ?
99 langues, dont l'anglais, l'espagnol, le mandarin, l'hindi, l'arabe, le français, le portugais, le russe, le japonais, l'allemand, le coréen, l'italien, et bien d'autres. La détection automatique se fait à partir des premières secondes.
Peut-il traduire l'audio en anglais ?
Oui. Cochez "Translate to English" et Whisper traduira tout audio non-anglais en texte anglais. Ou utilisez l'outil dédié Traducteur audio.
Quelle est la précision de la transcription ?
Très efficace pour la parole claire dans 99 langues. La précision peut diminuer en présence d'accents prononcés, de musique de fond, de locuteurs qui se chevauchent ou d'audio bruyant, car l'outil gratuit utilise un modèle plus léger dans votre navigateur. Pour les audios les plus difficiles, SnipSound Pro utilise le modèle grand format le plus performant sur des GPU cloud pour une précision maximale — paiement à l'utilisation, pas d'abonnement mensuel — et vous pouvez toujours modifier le résultat. Dans tous les cas, l'outil gratuit ne télécharge jamais votre fichier.
Comment cela se compare-t-il à Otter, Rev ou Descript ?
Ce sont des services cloud payants (environ 10 à 30 $/mois) qui téléchargent votre audio sur leurs serveurs. SnipSound transcrit gratuitement, directement dans votre navigateur — rien n'est téléchargé, pas de compte, pas de frais mensuels, pas de limite de temps par fichier. Lorsque vous avez besoin d'une précision de premier ordre sur des audios difficiles, SnipSound Pro utilise le plus grand modèle dans le cloud sur une base de paiement à l'utilisation au lieu d'un abonnement.
Puis-je transcrire une vidéo YouTube ?
Oui. Téléchargez la vidéo YouTube (ou seulement son audio) et déposez le fichier ici — nous le transcrivons localement dans votre navigateur et vous pouvez exporter des sous-titres .srt/.vtt. Nous ne récupérons pas directement les liens YouTube, ce qui est précisément ce qui garantit la confidentialité de vos données.
Puis-je modifier la transcription ?
Oui — cliquez sur ✎ Edit et retapez n'importe quelle ligne, ou utilisez Rechercher & Remplacer tout pour corriger un mot partout en une seule fois. Les modifications sont appliquées à toutes les exportations (.txt, .srt, .vtt). La plupart des transcripteurs gratuits sont en lecture seule.
Puis-je obtenir des sous-titres pour une vidéo ?
Oui — téléchargez des fichiers .srt ou .vtt avec horodatage. Fonctionne sur YouTube, Vimeo, la plupart des éditeurs vidéo. Déposez votre fichier vidéo directement ici — nous extrayons l'audio automatiquement.
Y a-t-il une limite de durée ?
60 minutes par fichier. Les fichiers plus longs utilisent trop de RAM du navigateur. Coupez avec notre Découpeur audio ou divisez avec le Séparateur audio first.
Combien de temps faut-il pour transcrire un fichier audio d'une heure ?
Dans votre navigateur, environ 15 minutes sur un ordinateur portable typique avec un navigateur WebGPU — gratuit, privé, utilisant le modèle de base Whisper. Les appareils plus anciens sans GPU peuvent être plus lents. Avec SnipSound Pro on cloud GPUs it's roughly 1.5 minutes, the same speed on any device, using the larger large-v3 model. (Measured on whisper-base in-browser vs whisper-large-v3-turbo on cloud GPUs.)
La transcription gratuite via navigateur est-elle précise ?
Oui — très efficace pour la parole claire dans 99 langues, exécutant le modèle de base de Whisper directement sur votre appareil sans rien télécharger. La précision peut diminuer en présence d'accents prononcés, de musique de fond ou de locuteurs qui se chevauchent, là où Pro's larger large-v3 model does better.
Quel est le moyen le plus rapide de transcrire un long podcast ou une interview ?
L'outil gratuit directement dans votre navigateur fonctionne et reste confidentiel, mais son temps de traitement est proportionnel à la durée du fichier (environ 15 min pour un fichier d'une heure sur un ordinateur portable standard) et il est limité à 60 minutes par fichier. L'option la plus rapide est SnipSound Pro, qui traite votre fichier sur des GPU cloud en 1 à 2 minutes environ, quelle que soit la durée ou l'appareil, et avec une meilleure précision.
La vitesse de transcription dépend-elle de mon navigateur ou de mon appareil ?
Oui — l'outil gratuit fonctionne sur votre propre matériel. Un navigateur avec WebGPU (Chrome, Edge ou la dernière version de Firefox) utilise votre GPU et est environ deux fois plus rapide qu'un navigateur qui n'utilise que le CPU, comme Brave (qui désactive WebGPU par défaut). Un fichier de 16 minutes prend environ ~4 min avec WebGPU, ~8 min sur un ordinateur portable qui n'utilise que le CPU, et jusqu'à ~18 min sur un vieil appareil monocœur de secours. Laissez votre ordinateur portable branché pour éviter que le mode économie d'énergie ne réduise les performances. Pro fonctionne sur des GPU cloud à la même vitesse sur n'importe quel appareil (environ 29 sec pour ce fichier).
Est-ce qu'on obtient des horodatages mot par mot ?
Oui — chaque mot est calé. La transcription met en évidence chaque mot karaoke-style pendant la lecture audio, et vous pouvez cliquer sur n'importe quel mot pour accéder à ce moment précis. Recherchez un mot et il est marqué sur la forme d'onde. Le calage est conservé dans vos exportations .srt et .vtt.
Puis-je transformer mon audio en vidéo sous-titrée ?
Oui — un clic transforme votre transcription en une vidéo sous-titrée mot par mot (grand texte animé) que vous pouvez télécharger et partager, idéal pour transformer un extrait de podcast ou une note vocale en vidéo pour les réseaux sociaux sans montage. Ou envoyez-le directement à l' Éditeur vidéo avec des sous-titres synchronisés mot par mot.
Puis-je censurer un mot ?
Oui — recherchez n'importe quel mot (un nom, un gros mot, n'importe quoi), Bip toutes les occurrences, et téléchargez l'audio nettoyé. C'est rare pour un outil gratuit et directement dans le navigateur. Pour un traitement dédié, consultez notre Suppresseur de vulgarités.