Free Audio Transcription

免費 AI 音訊 & 影片轉文字

SnipSound 的免費語音轉文字工具,能將音訊或影片轉換成文字,支援 99 種語言,直接在瀏覽器中完成。輕鬆將錄音、Podcast、訪談或語音備忘錄轉換成文字。立即體驗! 逐字時間戳記 搭配卡拉 OK 歌詞高亮顯示,製作 有字幕的影片,嗶掉任何字詞,並匯出 .txt、.srt 或 .vtt 檔案。檔案不會離開你的裝置。無需註冊。

沒有現成的檔案嗎?

拖放音訊或影片檔案

或點擊瀏覽。

MP3WAVOGGFLACAACM4AWEBMMP4MOV

沒有檔案? 使用我們的語音錄音機錄製一個 來測試轉錄功能如何運作。

100% 在你的瀏覽器中執行。 音訊保留在你的裝置上。Whisper AI 模型會從我們的伺服器下載一次(約 75 MB),然後在本地端為每次轉錄執行。我們無法存取你的音訊,因為它從未離開你的電腦。 隱私權政策.

file.mp3
音訊是什麼語言?
載入模型… 0%

Transcript

匯出選項:

您的檔案轉文字需要多久時間?

免費版 100% 在您的瀏覽器中運行 — 私密、免費,適用於大多數檔案。對於較長的檔案或追求最高準確度,Pro 版可在幾秒鐘內透過雲端 GPU 運行。

16 min
📁 自動填入此資訊
● 免費版 · 在您的瀏覽器中
100% 私密 · 免費
◆ Pro 版 · 雲端
Fastest · larger large-v3 model
正在偵測您的裝置…
Estimates from our own benchmarks (Whisper base in-browser vs large-v3-turbo on cloud GPUs). Free scales with your device; Pro is the same speed on any device.

免費版有什麼限制?

沒有隱藏費用 — 它真正免費、無限制且私密,因為它運行在 您的裝置上 而非我們的伺服器,所以我們沒有任何費用可收取。唯一的權衡是 time:您的電腦不如雲端 GPU 快速,所以語音轉文字需要幾分鐘。對於短音檔來說,這幾乎察覺不到。對於 長音檔 等待時間會累積 — 而這正是 Pro 發揮作用:同樣的工作在雲端 GPU 上只需幾秒鐘,且準確度更高,可在任何裝置上進行。

免費版 vs 專業版 — 一般語音轉文字時間

音檔長度免費 — 瀏覽器版*專業版 — 雲端版
10 min~2–3 分鐘~22 sec
30 min~7–8 分鐘~45 sec
1 hour~15 min~1.5 分鐘
2 hours先分割成 ≤60 分鐘的片段~2.5 分鐘

*Free times on a typical laptop with a WebGPU browser (Chrome/Edge); older devices without a GPU can be 2–4× slower. Free is capped at 60 minutes per file. Pro runs on cloud GPUs at the same speed on any device, using the larger large-v3 model for higher accuracy.

是什麼讓免費語音轉文字更快?

裝置與瀏覽器對速度的影響 — 16 分鐘檔案

您的裝置設定預計轉文字時間 (16 分鐘)
筆電或手機 支援 WebGPU (Chrome、Edge、最新版 Firefox)~4 min
手機,僅限 CPU (不支援 WebGPU)約 5–6 分鐘
Laptop 不支援 WebGPU (Brave 預設、舊版瀏覽器)~8 min
舊筆電,單核心備用模式最多約 18 分鐘
任何裝置,只要有 Pro (雲端 GPU)~29 sec

Measured on our own benchmarks with the Whisper base model in-browser (large-v3-turbo for Pro). Your exact time varies with your device's chip and the audio itself.

免費、私密的 AI 音訊 & 影片轉文字 — 運作方式

SnipSound 的語音轉文字工具採用 OpenAI 的開源 Whisper 語音辨識模型,透過 WebAssembly 完全在您的瀏覽器中運行。拖放音檔 or 或影片 — 對於影片,我們會自動提取音軌。當您首次點擊 Transcribe時,您的瀏覽器會從我們的伺服器下載一個約 75 MB 的模型檔案;之後,每次轉文字都會完全在本地進行。您的檔案絕不會上傳到任何伺服器 — 無論是我們的、OpenAI 的,還是任何其他人的。

專門處理影片?試試看 影片轉文字。只需要字幕檔嗎?那麼 SRT 產生器 會匯出可直接使用的 .srt/.vtt 檔案。

適用情境

編輯逐字稿 — 修正錯誤、尋找 & 取代

自動轉錄總是不完美,因此逐字稿可完全編輯。點擊 ✎ Edit 並點擊任何一行即可重新輸入聽錯的字詞 — 您的變更會自動儲存並應用於所有匯出檔案(.txt、.srt、.vtt 等其他格式)。使用 Find 跳轉到某個字詞出現的所有位置,然後 全部取代 一次性修正所有位置 — 非常適合修正 Whisper 在整個文件中拼錯的姓名、品牌或術語(例如,將所有「Mark」修正為「Marc」)。匹配是全字匹配,因此替換「a」不會影響其他單字中的字母 a。偏好原始輸出嗎?隨時在 Original and Edited 標籤頁之間切換 — 未經修改的原始檔案會隨文件一起儲存。

不適用情境

將音訊翻譯成英文

勾選「翻譯成英文」,Whisper 會將任何非英文音檔轉譯為英文文字。西班牙語 Podcast → 英文逐字稿。普通話訪談 → 英文筆記。 專用音訊翻譯工具在此 如果您的主要需求是翻譯。

支援 99 種語言的音檔轉文字

SnipSound 能將語音轉文字,支援 99 種語言,並提供可搜尋的語言選擇器以及 真實的自動語言偵測功能 — 它執行真正的語言識別程序,這是大多數瀏覽器工具無法做到的。在清晰的語音下,其準確度在主要語言中表現出色,包括 英文、西班牙文、法文、葡萄牙文、義大利文、德文、俄文、中文和日文 — 因此,它能直接在您的瀏覽器中處理「transcribir audio a texto」、「transcrire audio en texte」、「trascrizione audio」、「音声文字起こし」等更多功能。

幾點誠實的說明,讓您了解預期效果:準確度數據適用於 clear 語音 — 濃重口音或嘈雜音訊會降低任何裝置上模型的準確度 — 且部分資源較少的語言(其中包含印地語/烏爾都語)在免費模型上的表現較弱,因此語言選擇器會將其標示為「準確度有限」;對於這些語言,Pro 模型表現會更好。對於 中文和日文,語音轉文字和字幕表現出色;逐字點擊的精確度在拉丁語系語言上表現最佳。主要語言的本地化頁面正在陸續推出 — 或者您也可以直接打開工具並選擇您的語言(或讓自動偵測完成)。

不僅僅是逐字稿

除了語音轉文字,這個免費工具還能 在轉錄時將長檔案朗讀出來 (串流結果),讓您 編輯單字並保留其精確的字幕時間,顯示 most-said-words 分析,並能找到並播放每個單字的出現位置。完成後,一鍵即可將您的 影片和帶有時間戳的逐字稿直接傳送到免費的 影片編輯器 ,字幕已在時間軸上 — 稍後重新打開檔案會立即恢復其逐字稿。

審閱模式 是其一大亮點:AI 會將它不完全確定的單字加上底線,而審閱按鈕會引導您逐一檢查, 只重播該單字的音訊 讓您輕點一下即可保留或修正 — 您的判斷會被儲存。還有更多: 搜尋篩選器 將逐字稿與相符的句子對應,並在波形圖上標示出它們的位置, 尋找並全部取代 一次性修正所有聽錯的名字(時間戳記保持不變),並進行編輯 auto-save 重新上傳時還原,字幕影片會與您的來源影片長寬比一致,並帶有自己的播放控制項,還有一個帶有句子級別時間戳記的全螢幕逐字稿檢視。

SnipSound 對比 Otter.ai、Rev 與 Descript

人們通常會將 SnipSound 與其他付費雲端轉錄服務進行比較,例如 Otter.ai, Rev and Descript核心區別在於:那些服務會將您的音檔上傳到他們的伺服器,並收取月費或按分鐘計費,而 SnipSound 則是在 您的瀏覽器中免費運行 不上傳任何內容 — 只有可選的專業版方案才需要付費,而且是按次計費,無需訂閱。

FeatureSnipSoundOtter.aiRevDescript
Cost免費 — 專業版按次計費,無需訂閱免費增值,按月付費按分鐘計費 / 訂閱按月付費
您的音檔留在您的瀏覽器中 — 絕不上傳上傳到他們的伺服器UploadedUploaded
需要帳戶NoneRequiredRequiredRequired
語言(模型支援)99FewerFewerFewer
字詞級時間戳記YesYesYesYes
製作帶字幕影片是,內建NoNo是(付費)
每個檔案有免費上限60 分鐘,檔案數量不限免費分鐘數有限僅限試用免費版功能受限

一個免費、私密的 Otter.ai 替代方案 適合不希望音訊存放在第三方伺服器上的使用者。對於最難處理的音訊, SnipSound 專業版 在雲端 GPU 上運行最大模型,按使用量付費。

準確度如何?Pro 版何時值得升級?

對於清晰、單人說話的音訊,免費的瀏覽器內建模型(OpenAI 的 Whisper base) 非常準確。在我們的測試中,英文和西班牙文的準確度約為 100%,中文和日文的內容準確度約為 100%,法文約為 88%。在標準的清晰語音基準測試中,這大約是 95%; the Pro model (Whisper large-v3) is around 98%。實際環境中帶有背景噪音、音樂、濃重口音或多位說話者重疊的音訊,對任何模型來說都更具挑戰性,因此準確度會較低 — 我們從不聲稱有 99% 的準確度。

免費版有哪些限制?Pro 版如何幫你?

語言(清晰語音)免費瀏覽器內建模型
英文、西班牙文~100%
中文、日文近乎100%內容準確
French~88%
Hindi字詞時間點準確;免費版文字品質較弱 — 請使用 Pro

字詞同步字幕已在英語、西班牙語、法語、印地語、中文和日語(包括非拉丁語系文字)中驗證 — 每個字詞都帶有時間戳記,音訊覆蓋率達98–100%。 「99種語言」是指模型支援的語言;準確度因語言和音訊品質而異,免費版在清晰語音下約95%,專業版約98%。

常見問題

這真的是免費的嗎?
是的。無需帳戶、無需信用卡、無使用限制。語音轉文字在您的瀏覽器中執行,使用OpenAI的開源Whisper模型。
我的音訊會上傳到任何地方嗎?
不會。您的音訊檔案會保留在您的瀏覽器中。AI模型會從我們的伺服器下載一次並在本機快取 — 之後,語音轉文字功能將完全離線執行。
支援哪些語言?
支援99種語言,包括英語、西班牙語、國語、印地語、阿拉伯語、法語、葡萄牙語、俄語、日語、德語、韓語、義大利語等。自動偵測會從前幾秒的內容中選擇。
可以將音檔翻譯成英文嗎?
是的。勾選「翻譯成英文」,Whisper會將任何非英文音訊轉譯成英文文字。或者使用專用的 音訊翻譯器.
轉文字的準確度如何?
對於99種語言的清晰語音效果非常好。遇到口音重、背景音樂、多位講者同時說話或嘈雜的音訊時,準確度可能會下降,因為免費工具在您的瀏覽器中執行較輕量的模型。對於最難處理的音訊, SnipSound 專業版 會在雲端GPU上執行頂級大型模型,以提供最高準確度 — 按使用量付費,無月費訂閱 — 而且您仍然可以編輯結果。無論如何,免費工具絕不會上傳您的檔案。
這與Otter、Rev或Descript有何不同?
那些是付費雲端服務(每月約10–30美元),會將您的音訊上傳到他們的伺服器。SnipSound提供免費的語音轉文字服務,直接在您的瀏覽器中執行 — 不會上傳任何內容、無需帳戶、無月費、無單檔時間限制。當您需要處理困難音訊並要求頂級準確度時, SnipSound 專業版 會在雲端執行最大的模型,採用按使用量付費,而非訂閱制。
我可以將 YouTube 影片轉文字嗎?
是的。下載YouTube影片(或僅其音訊)然後將檔案拖放到此處 — 我們會在您的瀏覽器中進行本地語音轉文字,您可以匯出.srt/.vtt字幕。我們不直接從YouTube連結提取內容,這正是保護您資料隱私的方式。
我可以編輯逐字稿嗎?
是的 — 點擊 ✎ Edit 並重新輸入任何一行,或使用 尋找 & 取代全部 一次性修正所有出現的字詞。編輯會同步到所有匯出格式(.txt、.srt、.vtt)。大多數免費語音轉文字工具都是唯讀的。
我可以取得影片字幕嗎?
是的 — 下載帶有時間戳記的.srt或.vtt檔案。適用於YouTube、Vimeo和大多數影片編輯器。直接將您的影片檔案拖放到此處 — 我們會自動提取音訊。
有長度限制嗎?
每個檔案60分鐘。較長的檔案會佔用過多瀏覽器記憶體。使用我們的 音訊修剪器 或使用 音訊分割器 first.
將 1 小時的音檔轉文字需要多久時間?
在您的瀏覽器中,使用支援WebGPU的普通筆記型電腦約需15分鐘 — 免費、私密,使用Whisper基礎模型。沒有GPU的舊設備可能會較慢。使用 SnipSound 專業版 on cloud GPUs it's roughly 1.5 minutes, the same speed on any device, using the larger large-v3 model. (Measured on whisper-base in-browser vs whisper-large-v3-turbo on cloud GPUs.)
免費的瀏覽器轉文字準確嗎?
是的,對 99 種語言的清晰語音效果極佳,直接在您的裝置上執行 Whisper 的基礎模型,無需上傳任何內容。但在口音較重、背景音樂或多位說話者重疊的情況下,準確度可能會下降,這時 Pro's larger large-v3 model does better.
取得長篇 Podcast 或訪談的逐字稿,最快的方法是什麼?
這個免費的瀏覽器語音轉文字工具運作良好且保持私密,但它的處理時間會隨檔案長度增加 (在一般筆記型電腦上,1 小時的檔案約需 15 分鐘),且每個檔案上限為 60 分鐘。最快的選項是 SnipSound 專業版它在雲端 GPU 上處理您的檔案,大約 1-2 分鐘,不受檔案長度或裝置限制,且準確度更高。
我的瀏覽器或裝置會影響語音轉文字的速度嗎?
是的,這個免費工具在您的裝置上執行。支援以下功能的瀏覽器: WebGPU (Chrome、Edge 或最新版 Firefox) 能在您的 GPU 上執行,速度大約是 兩倍快 CPU 專用瀏覽器 (例如預設停用 WebGPU 的 Brave) 的兩倍。一個 16 分鐘的檔案,使用 WebGPU 大約需要 4 分鐘,在僅限 CPU 的筆記型電腦上約 8 分鐘,而在舊型單核心備用裝置上則可能長達 18 分鐘。請將筆記型電腦插上電源,以避免省電模式限制效能。 Pro 在任何裝置上,雲端 GPU 都能以相同速度執行 (該檔案約 29 秒)。
它會提供字詞級時間戳記嗎?
是的,每個字都有時間戳記。逐字稿會反白顯示每個字 karaoke-style 當音訊播放時,您可以點擊任何字詞跳到該時間點。搜尋一個字詞,它會標記在波形上。時間戳記會保留在您的 .srt 和 .vtt 匯出檔案中。
我可以將音訊轉成帶有字幕的影片嗎?
是的,一鍵即可將您的逐字稿轉換為 逐字字幕影片 (大型動畫文字) 您可以下載和分享,非常適合將播客片段或語音備忘錄轉換為無需編輯的社群影片。或者直接傳送到 影片編輯器 搭配逐字同步的字幕。
我可以消音或遮蔽某個字詞嗎?
是的,搜尋任何字詞 (姓名、髒話、任何內容), 嗶掉所有出現的字詞並下載清理後的音訊。對於免費的瀏覽器工具來說,這很罕見。如需專門處理,請參閱我們的 髒話移除器.