Free Audio Transcription

免费AI 音频 & 视频转录

SnipSound 的免费语音转文字工具,支持 99 种语言,无需下载,直接在浏览器中即可将音频或视频转换成文字。轻松将录音、播客、采访或语音备忘录转写成文本。(如:音频转文字、语音转文字、声音转文字)。立即体验 逐字时间戳 带卡拉OK式高亮显示,制作 带字幕视频,消音任何词语,并导出.txt、.srt或.vtt文件。文件不离开您的设备。无需注册。

手边没有文件?

拖入音频或视频文件

或点击浏览。

MP3WAVOGGFLACAACM4AWEBMMP4MOV

没有文件? 使用我们的录音机录制一个 来试试转录功能。

完全在你的浏览器中。 音频保留在您的设备上。Whisper AI模型会从我们的服务器下载一次(约75 MB),然后每次转录都在本地运行。我们无法访问您的音频,因为它从未离开您的电脑。 隐私政策.

file.mp3
音频是什么语言?
模型加载中… 0%

Transcript

导出选项:

您的文件转录需要多长时间?

免费版 100% 在浏览器中运行——私密、免费,适用于大多数文件。对于长文件或追求极致准确度,专业版在云端 GPU 上秒速完成。

16 min
📁 自动填写此项
● 免费版 · 在浏览器中
100% 私密 · 免费
◆ 专业版 · 云端
Fastest · larger large-v3 model
正在检测您的设备…
Estimates from our own benchmarks (Whisper base in-browser vs large-v3-turbo on cloud GPUs). Free scales with your device; Pro is the same speed on any device.

免费版有什么猫腻?

没有猫腻 — 它确实是免费、无限制且私密的,因为它运行在 你的设备上 而不是我们的服务器,所以我们没有任何理由收费。唯一的不足是 time:你的电脑不如云端 GPU 快,所以转录需要几分钟。对于短音频,这几乎察觉不到。对于 长文件 等待时间会累积 — 而这正是 Pro 派上用场:同样的任务在云端 GPU 上只需几秒,准确率更高,且可在任何设备上完成。

免费版 vs 专业版 — 典型转录时间

文件时长免费版 — 在你的浏览器中*专业版 — 云端
10 min约 2-3 分钟~22 sec
30 min约 7-8 分钟~45 sec
1 hour~15 min约 1.5 分钟
2 hours需先分割成不超过 60 分钟的部分约 2.5 分钟

*Free times on a typical laptop with a WebGPU browser (Chrome/Edge); older devices without a GPU can be 2–4× slower. Free is capped at 60 minutes per file. Pro runs on cloud GPUs at the same speed on any device, using the larger large-v3 model for higher accuracy.

如何让免费转录更快?

设备和浏览器速度对比 — 16 分钟文件

你的配置转录时间 (16 分钟)
笔记本电脑或手机 带 WebGPU (Chrome、Edge、最新版 Firefox)~4 min
手机,仅 CPU (无 WebGPU)约 5–6 分钟
Laptop 不带 WebGPU (Brave 默认、旧版浏览器)~8 min
旧笔记本电脑,单核回退最长约 18 分钟
任何设备 Pro (云端 GPU)~29 sec

Measured on our own benchmarks with the Whisper base model in-browser (large-v3-turbo for Pro). Your exact time varies with your device's chip and the audio itself.

免费、私密的 AI 音频和视频转录 — 工作原理

SnipSound 的转录工具使用 OpenAI 的开源 Whisper 语音识别模型,完全通过 WebAssembly 在你的浏览器中运行。拖入音频 or 视频 — 视频文件会自动提取音频。首次点击时 Transcribe,您的浏览器会从我们的服务器下载一个约75 MB的模型文件;此后,所有转录都在本地完成。您的文件绝不会上传到任何服务器——无论是我们的、OpenAI的,还是任何其他方的。

专门处理视频?试试 视频转文字。只需要字幕文件?我们的 SRT 生成器 可以导出即用的 .srt/.vtt 文件。

适用场景

编辑转录文本 — 修正错误,查找 & 替换

自动转录总会有不完美之处,因此转录文本可以完全编辑。点击 ✎ Edit 并点击任意一行,即可修改听错的词语 — 您的修改会自动保存,并体现在所有导出文件(.txt、.srt、.vtt 等)中。使用 Find 可跳转到某个词语出现的所有位置,然后 全部替换 一次性修正所有位置 — 非常适合修正 Whisper 在整个文本中拼错的名称、品牌或术语(例如,将所有“Mark”改为“Marc”)。匹配是整词匹配,所以替换“a”不会影响其他词语中的字母 a。喜欢原始输出?随时切换到 Original and Edited 标签页 — 未修改的原始文本会随文件一起保存。

不适用场景

将音频翻译成英文

勾选“翻译成英文”,Whisper 就会将任何非英语音频转译成英文文本。西班牙语播客 → 英文转录。普通话访谈 → 英文笔记。 专用音频翻译工具 如果您的主要需求是翻译。

支持99种语言的音频转录

SnipSound 支持以下语言的语音转录: 99种语言,带有可搜索的语言选择器和 真正的自动语言检测 — 它会进行真正的语言识别,这是大多数浏览器内工具无法做到的。对于清晰的语音,主要语言的准确性都很高,包括 英语、西班牙语、法语、葡萄牙语、意大利语、德语、俄语、中文和日语 — 因此,它能处理“transcribir audio a texto”、“transcrire audio en texte”、“trascrizione audio”、“音声文字起こし”等更多内容,就在你的浏览器中。

几点说明,让你了解实际情况:准确率数据适用于 clear 语音 — 浓重口音或嘈杂音频会降低任何设备端模型的准确率 — 少数低资源语言(包括印地语/乌尔都语)在免费模型上的表现较弱,这就是为什么语言选择器会为它们标记“准确率有限”的等级;对于这些语言,专业版模型表现更好。对于 中文和日语— 转录和字幕效果极佳;逐词点击的精准度在拉丁语系语言上表现最佳。主要语言的本地化页面正在陆续推出 — 或者直接打开工具选择你的语言(或让自动检测完成)。

不仅仅是转录

除了语音转文本,同一个免费工具还 在转录的同时将长文件朗读出来(流式结果) ,还让你 编辑词语,同时保持其精确的字幕时间,显示 most-said-words 分析,并查找和播放某个词语的所有出现之处。完成后,一键即可发送你的 视频和逐字同步字幕直接导出到免费的 视频编辑器 字幕已在时间轴上 — 稍后重新打开文件可立即恢复其字幕。

审阅模式 是其亮点:AI 会标记出任何它不确定的词语,“审阅”按钮会引导你逐一检查, 仅播放该词的音频 让你轻点一下即可保留或修改 — 你的修改会被保存。还有更多功能: 搜索过滤 过滤字幕以显示匹配的句子,并在波形图上标示出它们的位置, 查找 & 全部替换 一次性修正所有听错的名称(时间轴保持不变),编辑 auto-save 重新上传时可恢复,字幕视频会匹配源文件的宽高比并带有自己的播放控件,还有带有句子级时间戳的全屏字幕视图。

SnipSound 对比 Otter.ai, Rev & Descript

人们通常会将 SnipSound 与付费云转录工具(如 Otter.ai, Rev and Descript)进行比较。核心区别在于:它们会将你的音频上传到服务器,并收取月费或按分钟计费,而 SnipSound 则 在你的浏览器中免费运行 无需上传任何内容 — 只有可选的专业版才收费,并且是按次付费,无订阅。

FeatureSnipSoundOtter.aiRevDescript
Cost免费 — 专业版按次付费,无订阅免费增值,按月付费按分钟付费 / 订阅按月付费
你的音频保留在你的浏览器中 — 绝不上传上传到他们的服务器UploadedUploaded
需要账户NoneRequiredRequiredRequired
语言 (模型支持)99FewerFewerFewer
逐字时间戳YesYesYesYes
制作带字幕的视频是的,内置NoNo是的 (付费)
免费单文件上限60 分钟,文件数量不限免费时长有限仅限试用免费版有限制

一个免费、私密的 Otter.ai 替代品 适合不希望音频数据上传到第三方服务器的用户。对于最难处理的音频, SnipSound 专业版 在云端 GPU 上运行最大的模型,按使用量付费。

准确度如何 — 以及何时值得升级 Pro 版?

对于清晰的单人语音音频,免费的浏览器内置模型 (OpenAI 的 Whisper base) 非常准确。在我们的测试中,英语和西班牙语的准确率接近 100%,中文和日语的内容准确率也接近 100%,法语约为 88%。在标准的清晰语音基准测试中,这大致相当于 95%; the Pro model (Whisper large-v3) is around 98%。带有背景噪音、音乐、浓重口音或多说话人重叠的真实音频,对任何模型来说都更难处理,因此准确率会降低 — 我们从不声称能达到 99% 的准确率。

免费模型难以处理的情况 (以及 Pro 版的优势)

语言 (清晰语音)免费浏览器内模型
英语、西班牙语~100%
中文、日语内容准确率约100%
French~88%
Hindi词语时间点准确;免费版文本较弱 — 建议使用 Pro

词语同步字幕已在英语、西班牙语、法语、印地语、中文和日语(包括非拉丁文字)中验证 — 每个词语都带有时间戳,音频覆盖率达98-100%。“99种语言”指模型的语言支持范围;准确率因语言和音频质量而异,免费版在清晰语音下约为95%,Pro 版约为98%。

常见问题

这真的是免费的吗?
是的。无需注册账户,无需绑定银行卡,无使用限制。转录直接在您的浏览器中完成,使用的是OpenAI的开源Whisper模型。
我的音频会被上传吗?
不会。您的音频文件会保留在您的浏览器中。AI模型只会从我们的服务器下载一次并本地缓存,之后,转录将完全离线进行。
支持哪些语言?
支持99种语言,包括English、Spanish、Mandarin、Hindi、Arabic、French、Portuguese、Russian、Japanese、German、Korean、Italian以及更多。自动检测功能会在音频的前几秒内识别语言。
可以将音频翻译成英文吗?
是的。勾选“翻译成英文”,Whisper会将任何非English音频翻译成English文本。或者使用专用的 语音翻译.
转写准确度如何?
对于99种语言的清晰语音,效果非常好。但在口音较重、有背景音乐、多位说话者重叠或音频嘈杂的情况下,准确性可能会下降,因为这款免费工具在您的浏览器中运行的是一个轻量级模型。对于最难处理的音频, SnipSound 专业版 运行顶级大型模型,利用云端GPU实现最高准确度——按使用量付费,无月度订阅——并且您仍然可以编辑结果。无论哪种方式,免费工具都不会上传您的文件。
这与Otter、Rev或Descript相比如何?
它们是付费云服务(每月约10-30美元),会将您的音频上传到它们的服务器。SnipSound免费转录,直接在您的浏览器中进行——不上传任何内容,无需账户,无月费,无单文件时长限制。当您需要处理难度较高的音频并追求顶级准确度时, SnipSound 专业版 在云端运行最大的模型,按使用量付费,而非订阅制。
我可以转写 YouTube 视频吗?
是的。下载YouTube视频(或仅其音频),然后将文件拖放到这里——我们会在您的浏览器中本地转录,您可以导出.srt/.vtt字幕。我们不直接从YouTube链接抓取内容,这正是保护您数据隐私的方式。
可以编辑文字稿吗?
是的——点击 ✎ Edit 并重新输入任何一行,或使用 查找并替换全部 一次性修改所有出现的词语。编辑内容会同步到所有导出格式(.txt, .srt, .vtt)。大多数免费转录工具都是只读的。
可以为视频生成字幕吗?
是的——下载带时间戳的.srt或.vtt文件。可在YouTube、Vimeo和大多数视频编辑器中使用。直接将您的视频文件拖放到这里——我们会自动提取音频。
有文件时长限制吗?
每个文件最长60分钟。更长的文件会占用过多的浏览器内存。可以使用我们的 音频剪辑工具 或使用 音频分割器 first.
转写一个 1 小时的音频文件需要多长时间?
在您的浏览器中,一台配备WebGPU浏览器的普通笔记本电脑大约需要15分钟——免费、私密,使用的是Whisper基础模型。没有GPU的旧设备可能会慢一些。使用 SnipSound 专业版 on cloud GPUs it's roughly 1.5 minutes, the same speed on any device, using the larger large-v3 model. (Measured on whisper-base in-browser vs whisper-large-v3-turbo on cloud GPUs.)
免费的浏览器转写准确吗?
是的——对于99种语言的清晰语音,效果非常好,Whisper基础模型直接在您的设备上运行,无需上传任何内容。但在口音较重、有背景音乐或多位说话者重叠的情况下,准确性可能会下降,因为 Pro's larger large-v3 model does better.
如何最快地转录长播客或采访?
免费的网页工具运行良好且保护隐私,但处理时长会随文件长度增加(在普通笔记本电脑上,处理1小时文件大约需要15分钟),且单个文件最长60分钟。最快的选项是 SnipSound 专业版,它在云端GPU上运行,无论文件长度或设备,都能在1-2分钟内完成,且准确率更高。
我的浏览器或设备会影响转录速度吗?
是的,免费工具在您自己的设备上运行。支持 WebGPU (Chrome、Edge 或最新版 Firefox) 的浏览器会利用您的显卡运行,速度大约是 快一倍 只使用CPU的浏览器(如Brave,它默认禁用WebGPU)的。一个16分钟的文件,使用WebGPU大约需要4分钟,在只使用CPU的笔记本电脑上大约需要8分钟,而在老旧的单核备用设备上则可能长达18分钟。为避免省电模式限制性能,请保持笔记本电脑插电。 Pro 在云端GPU上运行,无论何种设备,速度都相同(处理该文件大约29秒)。
提供逐字时间戳吗?
是的 — 每个词语都带有时间戳。转录文本会高亮显示每个词语 karaoke-style 随着音频播放,你可以点击任何词语跳转到对应时间点。搜索一个词语,它会在波形图上被标记出来。时间信息会保留在你的 .srt 和 .vtt 导出文件中。
我能把音频转成带字幕的视频吗?
是的 — 一键即可将你的转录文本转换为 逐词字幕视频 (大号动态文字),你可以下载和分享,非常适合将播客片段或语音备忘录无需编辑地转换为社交媒体视频。或者直接发送到 视频编辑器 带有词语同步字幕。
我能给某个词消音或审查吗?
是的 — 搜索任何词语(姓名、脏话,任何内容), 将所有出现的地方消音,并下载清理后的音频。对于免费的浏览器内工具来说,这很少见。如需专用处理,请查看我们的 脏话移除器.