免费AI 音频 & 视频转录
SnipSound 的免费语音转文字工具,支持 99 种语言,无需下载,直接在浏览器中即可将音频或视频转换成文字。轻松将录音、播客、采访或语音备忘录转写成文本。(如:音频转文字、语音转文字、声音转文字)。立即体验 逐字时间戳 带卡拉OK式高亮显示,制作 带字幕视频,消音任何词语,并导出.txt、.srt或.vtt文件。文件不离开您的设备。无需注册。
拖入音频或视频文件
或点击浏览。
没有文件? 使用我们的录音机录制一个 来试试转录功能。
完全在你的浏览器中。 音频保留在您的设备上。Whisper AI模型会从我们的服务器下载一次(约75 MB),然后每次转录都在本地运行。我们无法访问您的音频,因为它从未离开您的电脑。 隐私政策.
Transcript
您的文件转录需要多长时间?
免费版 100% 在浏览器中运行——私密、免费,适用于大多数文件。对于长文件或追求极致准确度,专业版在云端 GPU 上秒速完成。
免费版有什么猫腻?
没有猫腻 — 它确实是免费、无限制且私密的,因为它运行在 你的设备上 而不是我们的服务器,所以我们没有任何理由收费。唯一的不足是 time:你的电脑不如云端 GPU 快,所以转录需要几分钟。对于短音频,这几乎察觉不到。对于 长文件 等待时间会累积 — 而这正是 Pro 派上用场:同样的任务在云端 GPU 上只需几秒,准确率更高,且可在任何设备上完成。
免费版 vs 专业版 — 典型转录时间
| 文件时长 | 免费版 — 在你的浏览器中* | 专业版 — 云端 |
|---|---|---|
| 10 min | 约 2-3 分钟 | ~22 sec |
| 30 min | 约 7-8 分钟 | ~45 sec |
| 1 hour | ~15 min | 约 1.5 分钟 |
| 2 hours | 需先分割成不超过 60 分钟的部分 | 约 2.5 分钟 |
*Free times on a typical laptop with a WebGPU browser (Chrome/Edge); older devices without a GPU can be 2–4× slower. Free is capped at 60 minutes per file. Pro runs on cloud GPUs at the same speed on any device, using the larger large-v3 model for higher accuracy.
如何让免费转录更快?
- 使用 WebGPU 浏览器 — Chrome 或 Edge (以及最新版 Firefox) 会在你的 GPU 上运行,大约 快 2 倍 比仅使用 CPU 的浏览器。Brave 默认禁用 WebGPU。
- 保持笔记本电脑插电 — 省电模式会限制 CPU/GPU 性能,转录时间可能会翻倍。
- 关闭其他占用资源多的标签页和应用 — 转录会占用 CPU/GPU 和内存,请释放资源。
- 有 GPU 的设备会快很多 — 配备 WebGPU 的新手机或笔记本电脑,比只有 CPU 的旧机器快得多(现代手机甚至比没有 GPU 的笔记本电脑还快)。
- 首次运行会下载一次模型 — 只需等待一次;之后的每次转录都会跳过这一步。
设备和浏览器速度对比 — 16 分钟文件
| 你的配置 | 转录时间 (16 分钟) |
|---|---|
| 笔记本电脑或手机 带 WebGPU (Chrome、Edge、最新版 Firefox) | ~4 min |
| 手机,仅 CPU (无 WebGPU) | 约 5–6 分钟 |
| Laptop 不带 WebGPU (Brave 默认、旧版浏览器) | ~8 min |
| 旧笔记本电脑,单核回退 | 最长约 18 分钟 |
| 任何设备 Pro (云端 GPU) | ~29 sec |
Measured on our own benchmarks with the Whisper base model in-browser (large-v3-turbo for Pro). Your exact time varies with your device's chip and the audio itself.
免费、私密的 AI 音频和视频转录 — 工作原理
SnipSound 的转录工具使用 OpenAI 的开源 Whisper 语音识别模型,完全通过 WebAssembly 在你的浏览器中运行。拖入音频 or 视频 — 视频文件会自动提取音频。首次点击时 Transcribe,您的浏览器会从我们的服务器下载一个约75 MB的模型文件;此后,所有转录都在本地完成。您的文件绝不会上传到任何服务器——无论是我们的、OpenAI的,还是任何其他方的。
专门处理视频?试试 视频转文字。只需要字幕文件?我们的 SRT 生成器 可以导出即用的 .srt/.vtt 文件。
适用场景
- 转录播客访谈、会议录音、语音备忘录、讲座,或任何清晰的语音音频。
- 为视频添加字幕——自动生成 .srt 和 .vtt 格式的字幕文件,带有精准时间戳,可直接导入 YouTube、Vimeo 或任何剪辑器。
- Otter、Rev 和 Descript 的免费隐私替代品,适用于记者、研究人员、学生和创作者 — 无需订阅,无需上传,无文件时长限制。
- 不想上传到第三方服务器的隐私音频 — 例如治疗笔记、机密访谈、内部会议。
- 逐字时间戳 — 卡拉OK式逐词高亮,点击即可跳转,方便你提取精准引文或制作精准字幕。
- 将音频转为带字幕的视频 — 一键生成逐词字幕视频,适用于播客、语音备忘录和社交短片,可下载和分享。
- 哔掉或审查词语 — 搜索任意词语并将其所有出现的地方静音,然后下载纯净音频(搭配我们的 脏话移除器).
编辑转录文本 — 修正错误,查找 & 替换
自动转录总会有不完美之处,因此转录文本可以完全编辑。点击 ✎ Edit 并点击任意一行,即可修改听错的词语 — 您的修改会自动保存,并体现在所有导出文件(.txt、.srt、.vtt 等)中。使用 Find 可跳转到某个词语出现的所有位置,然后 全部替换 一次性修正所有位置 — 非常适合修正 Whisper 在整个文本中拼错的名称、品牌或术语(例如,将所有“Mark”改为“Marc”)。匹配是整词匹配,所以替换“a”不会影响其他词语中的字母 a。喜欢原始输出?随时切换到 Original and Edited 标签页 — 未修改的原始文本会随文件一起保存。
不适用场景
- 背景噪音过大、语音中夹杂音乐,或多位说话者重叠 — 轻量版 Whisper 在这些情况下表现不佳。
- 浓重口音或非主流方言 — 更大的 Whisper 模型能更好地处理这些情况,但对浏览器来说过于庞大。
- 说话人区分(“谁说了什么”) — Whisper-tiny 不支持此功能。
- 超过 60 分钟的文件 — 我们限制了输入时长,以控制浏览器内存占用。
将音频翻译成英文
勾选“翻译成英文”,Whisper 就会将任何非英语音频转译成英文文本。西班牙语播客 → 英文转录。普通话访谈 → 英文笔记。 专用音频翻译工具 如果您的主要需求是翻译。
支持99种语言的音频转录
SnipSound 支持以下语言的语音转录: 99种语言,带有可搜索的语言选择器和 真正的自动语言检测 — 它会进行真正的语言识别,这是大多数浏览器内工具无法做到的。对于清晰的语音,主要语言的准确性都很高,包括 英语、西班牙语、法语、葡萄牙语、意大利语、德语、俄语、中文和日语 — 因此,它能处理“transcribir audio a texto”、“transcrire audio en texte”、“trascrizione audio”、“音声文字起こし”等更多内容,就在你的浏览器中。
几点说明,让你了解实际情况:准确率数据适用于 clear 语音 — 浓重口音或嘈杂音频会降低任何设备端模型的准确率 — 少数低资源语言(包括印地语/乌尔都语)在免费模型上的表现较弱,这就是为什么语言选择器会为它们标记“准确率有限”的等级;对于这些语言,专业版模型表现更好。对于 中文和日语— 转录和字幕效果极佳;逐词点击的精准度在拉丁语系语言上表现最佳。主要语言的本地化页面正在陆续推出 — 或者直接打开工具选择你的语言(或让自动检测完成)。
不仅仅是转录
除了语音转文本,同一个免费工具还 在转录的同时将长文件朗读出来(流式结果) ,还让你 编辑词语,同时保持其精确的字幕时间,显示 most-said-words 分析,并查找和播放某个词语的所有出现之处。完成后,一键即可发送你的 视频和逐字同步字幕直接导出到免费的 视频编辑器 字幕已在时间轴上 — 稍后重新打开文件可立即恢复其字幕。
审阅模式 是其亮点:AI 会标记出任何它不确定的词语,“审阅”按钮会引导你逐一检查, 仅播放该词的音频 让你轻点一下即可保留或修改 — 你的修改会被保存。还有更多功能: 搜索过滤 过滤字幕以显示匹配的句子,并在波形图上标示出它们的位置, 查找 & 全部替换 一次性修正所有听错的名称(时间轴保持不变),编辑 auto-save 重新上传时可恢复,字幕视频会匹配源文件的宽高比并带有自己的播放控件,还有带有句子级时间戳的全屏字幕视图。
SnipSound 对比 Otter.ai, Rev & Descript
人们通常会将 SnipSound 与付费云转录工具(如 Otter.ai, Rev and Descript)进行比较。核心区别在于:它们会将你的音频上传到服务器,并收取月费或按分钟计费,而 SnipSound 则 在你的浏览器中免费运行 无需上传任何内容 — 只有可选的专业版才收费,并且是按次付费,无订阅。
| Feature | SnipSound | Otter.ai | Rev | Descript |
|---|---|---|---|---|
| Cost | 免费 — 专业版按次付费,无订阅 | 免费增值,按月付费 | 按分钟付费 / 订阅 | 按月付费 |
| 你的音频 | 保留在你的浏览器中 — 绝不上传 | 上传到他们的服务器 | Uploaded | Uploaded |
| 需要账户 | None | Required | Required | Required |
| 语言 (模型支持) | 99 | Fewer | Fewer | Fewer |
| 逐字时间戳 | Yes | Yes | Yes | Yes |
| 制作带字幕的视频 | 是的,内置 | No | No | 是的 (付费) |
| 免费单文件上限 | 60 分钟,文件数量不限 | 免费时长有限 | 仅限试用 | 免费版有限制 |
一个免费、私密的 Otter.ai 替代品 适合不希望音频数据上传到第三方服务器的用户。对于最难处理的音频, SnipSound 专业版 在云端 GPU 上运行最大的模型,按使用量付费。
准确度如何 — 以及何时值得升级 Pro 版?
对于清晰的单人语音音频,免费的浏览器内置模型 (OpenAI 的 Whisper base) 非常准确。在我们的测试中,英语和西班牙语的准确率接近 100%,中文和日语的内容准确率也接近 100%,法语约为 88%。在标准的清晰语音基准测试中,这大致相当于 95%; the Pro model (Whisper large-v3) is around 98%。带有背景噪音、音乐、浓重口音或多说话人重叠的真实音频,对任何模型来说都更难处理,因此准确率会降低 — 我们从不声称能达到 99% 的准确率。
免费模型难以处理的情况 (以及 Pro 版的优势)
- 浓重口音、专有名词、人名、行业术语和缩写 — 较小的免费模型更容易听错不常见的词语;Pro 版的更大模型则能更准确地识别。
- 语音下的背景音乐或噪音,以及说话人重叠 — 这两者对浏览器大小的模型来说都很难处理,并且两种模型都无法区分说话人。
- 某些语言。 免费模型在主要欧洲语言以及中文和日语方面表现出色,但对其他语言则较弱。例如, Hindi 免费模型中,相关问题可能会再次出现 乌尔都语文字 存在语音漂移 — 印地语和乌尔都语是同一种口语,这是较小模型的已知局限。 词语时间点保持准确但文本质量会受影响。Pro 版的更大模型能更好地处理印地语和其他更难的语言。
| 语言 (清晰语音) | 免费浏览器内模型 |
|---|---|
| 英语、西班牙语 | ~100% |
| 中文、日语 | 内容准确率约100% |
| French | ~88% |
| Hindi | 词语时间点准确;免费版文本较弱 — 建议使用 Pro |
词语同步字幕已在英语、西班牙语、法语、印地语、中文和日语(包括非拉丁文字)中验证 — 每个词语都带有时间戳,音频覆盖率达98-100%。“99种语言”指模型的语言支持范围;准确率因语言和音频质量而异,免费版在清晰语音下约为95%,Pro 版约为98%。