免費 AI 音訊 & 影片轉文字
SnipSound 的免費語音轉文字工具,能將音訊或影片轉換成文字,支援 99 種語言,直接在瀏覽器中完成。輕鬆將錄音、Podcast、訪談或語音備忘錄轉換成文字。立即體驗! 逐字時間戳記 搭配卡拉 OK 歌詞高亮顯示,製作 有字幕的影片,嗶掉任何字詞,並匯出 .txt、.srt 或 .vtt 檔案。檔案不會離開你的裝置。無需註冊。
拖放音訊或影片檔案
或點擊瀏覽。
沒有檔案? 使用我們的語音錄音機錄製一個 來測試轉錄功能如何運作。
100% 在你的瀏覽器中執行。 音訊保留在你的裝置上。Whisper AI 模型會從我們的伺服器下載一次(約 75 MB),然後在本地端為每次轉錄執行。我們無法存取你的音訊,因為它從未離開你的電腦。 隱私權政策.
Transcript
您的檔案轉文字需要多久時間?
免費版 100% 在您的瀏覽器中運行 — 私密、免費,適用於大多數檔案。對於較長的檔案或追求最高準確度,Pro 版可在幾秒鐘內透過雲端 GPU 運行。
免費版有什麼限制?
沒有隱藏費用 — 它真正免費、無限制且私密,因為它運行在 您的裝置上 而非我們的伺服器,所以我們沒有任何費用可收取。唯一的權衡是 time:您的電腦不如雲端 GPU 快速,所以語音轉文字需要幾分鐘。對於短音檔來說,這幾乎察覺不到。對於 長音檔 等待時間會累積 — 而這正是 Pro 發揮作用:同樣的工作在雲端 GPU 上只需幾秒鐘,且準確度更高,可在任何裝置上進行。
免費版 vs 專業版 — 一般語音轉文字時間
| 音檔長度 | 免費 — 瀏覽器版* | 專業版 — 雲端版 |
|---|---|---|
| 10 min | ~2–3 分鐘 | ~22 sec |
| 30 min | ~7–8 分鐘 | ~45 sec |
| 1 hour | ~15 min | ~1.5 分鐘 |
| 2 hours | 先分割成 ≤60 分鐘的片段 | ~2.5 分鐘 |
*Free times on a typical laptop with a WebGPU browser (Chrome/Edge); older devices without a GPU can be 2–4× slower. Free is capped at 60 minutes per file. Pro runs on cloud GPUs at the same speed on any device, using the larger large-v3 model for higher accuracy.
是什麼讓免費語音轉文字更快?
- 使用 WebGPU 瀏覽器 — Chrome 或 Edge (以及最新版 Firefox) 會在您的 GPU 上運行,大約 快 2 倍 比僅使用 CPU 的瀏覽器。Brave 預設會停用 WebGPU。
- 筆記型電腦請保持插電 — 省電模式會限制您的 CPU/GPU 效能,並可能使時間增加近一倍。
- 關閉其他耗資源的分頁和應用程式 — 語音轉文字會用到您的 CPU/GPU 和記憶體;請釋放這些資源。
- 有 GPU 的裝置速度會快很多 — 支援 WebGPU 的新手機或筆電,比只有 CPU 的舊機器快很多(現代手機甚至比沒有 GPU 的筆電還快)。
- 首次執行會下載模型一次 — 只需等待一次;之後每次轉文字都會跳過此步驟。
裝置與瀏覽器對速度的影響 — 16 分鐘檔案
| 您的裝置設定 | 預計轉文字時間 (16 分鐘) |
|---|---|
| 筆電或手機 支援 WebGPU (Chrome、Edge、最新版 Firefox) | ~4 min |
| 手機,僅限 CPU (不支援 WebGPU) | 約 5–6 分鐘 |
| Laptop 不支援 WebGPU (Brave 預設、舊版瀏覽器) | ~8 min |
| 舊筆電,單核心備用模式 | 最多約 18 分鐘 |
| 任何裝置,只要有 Pro (雲端 GPU) | ~29 sec |
Measured on our own benchmarks with the Whisper base model in-browser (large-v3-turbo for Pro). Your exact time varies with your device's chip and the audio itself.
免費、私密的 AI 音訊 & 影片轉文字 — 運作方式
SnipSound 的語音轉文字工具採用 OpenAI 的開源 Whisper 語音辨識模型,透過 WebAssembly 完全在您的瀏覽器中運行。拖放音檔 or 或影片 — 對於影片,我們會自動提取音軌。當您首次點擊 Transcribe時,您的瀏覽器會從我們的伺服器下載一個約 75 MB 的模型檔案;之後,每次轉文字都會完全在本地進行。您的檔案絕不會上傳到任何伺服器 — 無論是我們的、OpenAI 的,還是任何其他人的。
專門處理影片?試試看 影片轉文字。只需要字幕檔嗎?那麼 SRT 產生器 會匯出可直接使用的 .srt/.vtt 檔案。
適用情境
- 將 Podcast 訪談、會議錄音、語音備忘錄、講座或任何清晰的語音音檔轉為文字。
- 為影片加上字幕 — 自動產生 .srt 和 .vtt 字幕檔,附帶精準時間戳記,可直接用於 YouTube、Vimeo 或任何編輯器。
- 記者、研究人員、學生和創作者的免費、保護隱私的 Otter、Rev 和 Descript 替代方案 — 無需訂閱、無需上傳檔案、無單檔時間限制。
- 隱私敏感的音檔,您不希望上傳到第三方伺服器 — 例如治療筆記、機密訪談、內部會議。
- 字詞級時間戳記 — 像卡拉 OK 一樣的字詞高亮顯示和點擊跳轉功能,讓您能擷取精確引言或製作精準字幕。
- 將音檔轉為帶字幕的影片 — 一鍵生成逐字字幕影片,適用於 Podcast、語音備忘錄和社群短片,可下載和分享。
- 嗶聲或遮蔽字詞 — 搜尋任何字詞並將所有出現的字詞靜音,然後下載乾淨的音檔(可搭配我們的 髒話移除器).
編輯逐字稿 — 修正錯誤、尋找 & 取代
自動轉錄總是不完美,因此逐字稿可完全編輯。點擊 ✎ Edit 並點擊任何一行即可重新輸入聽錯的字詞 — 您的變更會自動儲存並應用於所有匯出檔案(.txt、.srt、.vtt 等其他格式)。使用 Find 跳轉到某個字詞出現的所有位置,然後 全部取代 一次性修正所有位置 — 非常適合修正 Whisper 在整個文件中拼錯的姓名、品牌或術語(例如,將所有「Mark」修正為「Marc」)。匹配是全字匹配,因此替換「a」不會影響其他單字中的字母 a。偏好原始輸出嗎?隨時在 Original and Edited 標籤頁之間切換 — 未經修改的原始檔案會隨文件一起儲存。
不適用情境
- 大量背景噪音、語音後方的音樂,或多個重疊的說話者 — 小型 Whisper 模型難以處理這些情況。
- 濃重口音或非主流方言 — 較大的 Whisper 模型能更好地處理這些情況,但對於瀏覽器來說太過龐大。
- 說話者分離(「誰說了什麼」)— 不受 Whisper-tiny 支援。
- 超過 60 分鐘的檔案 — 我們限制輸入長度以控制瀏覽器記憶體使用。
將音訊翻譯成英文
勾選「翻譯成英文」,Whisper 會將任何非英文音檔轉譯為英文文字。西班牙語 Podcast → 英文逐字稿。普通話訪談 → 英文筆記。 專用音訊翻譯工具在此 如果您的主要需求是翻譯。
支援 99 種語言的音檔轉文字
SnipSound 能將語音轉文字,支援 99 種語言,並提供可搜尋的語言選擇器以及 真實的自動語言偵測功能 — 它執行真正的語言識別程序,這是大多數瀏覽器工具無法做到的。在清晰的語音下,其準確度在主要語言中表現出色,包括 英文、西班牙文、法文、葡萄牙文、義大利文、德文、俄文、中文和日文 — 因此,它能直接在您的瀏覽器中處理「transcribir audio a texto」、「transcrire audio en texte」、「trascrizione audio」、「音声文字起こし」等更多功能。
幾點誠實的說明,讓您了解預期效果:準確度數據適用於 clear 語音 — 濃重口音或嘈雜音訊會降低任何裝置上模型的準確度 — 且部分資源較少的語言(其中包含印地語/烏爾都語)在免費模型上的表現較弱,因此語言選擇器會將其標示為「準確度有限」;對於這些語言,Pro 模型表現會更好。對於 中文和日文,語音轉文字和字幕表現出色;逐字點擊的精確度在拉丁語系語言上表現最佳。主要語言的本地化頁面正在陸續推出 — 或者您也可以直接打開工具並選擇您的語言(或讓自動偵測完成)。
不僅僅是逐字稿
除了語音轉文字,這個免費工具還能 在轉錄時將長檔案朗讀出來 (串流結果),讓您 編輯單字並保留其精確的字幕時間,顯示 most-said-words 分析,並能找到並播放每個單字的出現位置。完成後,一鍵即可將您的 影片和帶有時間戳的逐字稿直接傳送到免費的 影片編輯器 ,字幕已在時間軸上 — 稍後重新打開檔案會立即恢復其逐字稿。
審閱模式 是其一大亮點:AI 會將它不完全確定的單字加上底線,而審閱按鈕會引導您逐一檢查, 只重播該單字的音訊 讓您輕點一下即可保留或修正 — 您的判斷會被儲存。還有更多: 搜尋篩選器 將逐字稿與相符的句子對應,並在波形圖上標示出它們的位置, 尋找並全部取代 一次性修正所有聽錯的名字(時間戳記保持不變),並進行編輯 auto-save 重新上傳時還原,字幕影片會與您的來源影片長寬比一致,並帶有自己的播放控制項,還有一個帶有句子級別時間戳記的全螢幕逐字稿檢視。
SnipSound 對比 Otter.ai、Rev 與 Descript
人們通常會將 SnipSound 與其他付費雲端轉錄服務進行比較,例如 Otter.ai, Rev and Descript核心區別在於:那些服務會將您的音檔上傳到他們的伺服器,並收取月費或按分鐘計費,而 SnipSound 則是在 您的瀏覽器中免費運行 不上傳任何內容 — 只有可選的專業版方案才需要付費,而且是按次計費,無需訂閱。
| Feature | SnipSound | Otter.ai | Rev | Descript |
|---|---|---|---|---|
| Cost | 免費 — 專業版按次計費,無需訂閱 | 免費增值,按月付費 | 按分鐘計費 / 訂閱 | 按月付費 |
| 您的音檔 | 留在您的瀏覽器中 — 絕不上傳 | 上傳到他們的伺服器 | Uploaded | Uploaded |
| 需要帳戶 | None | Required | Required | Required |
| 語言(模型支援) | 99 | Fewer | Fewer | Fewer |
| 字詞級時間戳記 | Yes | Yes | Yes | Yes |
| 製作帶字幕影片 | 是,內建 | No | No | 是(付費) |
| 每個檔案有免費上限 | 60 分鐘,檔案數量不限 | 免費分鐘數有限 | 僅限試用 | 免費版功能受限 |
一個免費、私密的 Otter.ai 替代方案 適合不希望音訊存放在第三方伺服器上的使用者。對於最難處理的音訊, SnipSound 專業版 在雲端 GPU 上運行最大模型,按使用量付費。
準確度如何?Pro 版何時值得升級?
對於清晰、單人說話的音訊,免費的瀏覽器內建模型(OpenAI 的 Whisper base) 非常準確。在我們的測試中,英文和西班牙文的準確度約為 100%,中文和日文的內容準確度約為 100%,法文約為 88%。在標準的清晰語音基準測試中,這大約是 95%; the Pro model (Whisper large-v3) is around 98%。實際環境中帶有背景噪音、音樂、濃重口音或多位說話者重疊的音訊,對任何模型來說都更具挑戰性,因此準確度會較低 — 我們從不聲稱有 99% 的準確度。
免費版有哪些限制?Pro 版如何幫你?
- 濃重口音、專有名詞、人名、術語和縮寫 — 較小的免費模型更容易聽錯罕見詞彙;Pro 的較大模型則能更常正確識別。
- 語音下的背景音樂或噪音,以及說話者重疊 — 對於瀏覽器大小的模型來說,這兩者都很難處理,而且兩種模型都無法標示誰說了什麼。
- 某些語言。 免費模型對於主要的歐洲語言,以及中文和日文表現出色,但在其他語言上則較弱。例如, Hindi 在免費模型上可能會以相關的 烏爾都語文字 帶有語音漂移 — 印地語和烏爾都語是相同的口語,這是較小模型的已知限制。而 單詞時間保持準確;受影響的是文字內容。Pro 的較大模型能更好地處理印地語和其他較難的語言。
| 語言(清晰語音) | 免費瀏覽器內建模型 |
|---|---|
| 英文、西班牙文 | ~100% |
| 中文、日文 | 近乎100%內容準確 |
| French | ~88% |
| Hindi | 字詞時間點準確;免費版文字品質較弱 — 請使用 Pro |
字詞同步字幕已在英語、西班牙語、法語、印地語、中文和日語(包括非拉丁語系文字)中驗證 — 每個字詞都帶有時間戳記,音訊覆蓋率達98–100%。 「99種語言」是指模型支援的語言;準確度因語言和音訊品質而異,免費版在清晰語音下約95%,專業版約98%。