Free Audio Transcription

無料AI 音声&動画の文字起こし

SnipSoundの無料文字起こしツールを使えば、音声や動画を99言語のテキストに変換できます。ブラウザ上で直接、音声録音、ポッドキャスト、インタビュー、ボイスメモなどを手軽に文字起こししましょう。 単語レベルのタイムスタンプ カラオケ風ハイライト、 字幕付き動画の作成、単語のピー音処理、そして.txt、.srt、.vtt形式でのエクスポートが可能です。ファイルはデバイスから離れず、登録も不要です。

ファイルが手元にないですか?

音声または動画ファイルをドロップ

またはクリックして参照。

MP3WAVOGGFLACAACM4AWEBMMP4MOV

ファイルをお持ちでないですか? 弊社のボイスレコーダーで録音する 文字起こしがどのように機能するかお試しください。

100%ブラウザで完結。 音声はあなたのデバイスに保存されます。Whisper AIモデル(約75MB)は弊社のサーバーから一度ダウンロードされ、その後はすべての文字起こしをローカルで実行します。音声があなたのコンピューターから離れることはないため、弊社がアクセスすることはありません。 プライバシーポリシー.

file.mp3
音声の言語は何ですか?
モデルを読み込み中… 0%

Transcript

エクスポートオプション:

ファイルの文字起こしにはどのくらい時間がかかりますか?

無料版は100%ブラウザで動作します — プライベート、無料、ほとんどのファイルに最適です。長いファイルや最高の精度が必要な場合は、Pro版がクラウドGPUで数秒で処理します。

16 min
📁 自動で入力するには
● 無料版 · ブラウザで実行
100%プライベート · 無料
◆ Pro版 · クラウド
Fastest · larger large-v3 model
デバイスを検出中…
Estimates from our own benchmarks (Whisper base in-browser vs large-v3-turbo on cloud GPUs). Free scales with your device; Pro is the same speed on any device.

無料版の落とし穴は?

いいえ、隠れたものはありません。これは本当に無料で、無制限、プライベートです。なぜなら、動作するのは お使いのデバイス 当社のサーバーではなく、お使いのデバイスで動作するため、当社が料金をいただく必要はありません。唯一のトレードオフは timeお使いのコンピューターはクラウドGPUほど高速ではないため、文字起こしに数分かかります。短いクリップならほとんど気になりません。しかし、 長いファイルでは 待ち時間がかさみます。そして、そのような場合にこそ Pro 真価を発揮します。クラウドGPUなら、同じ作業が数秒で、より高い精度で、どのデバイスでも可能です。

無料版とPro版 — 標準的な文字起こし時間

ファイルの長さ無料版 — ブラウザで*Pro版 — クラウド
10 min約2~3分~22 sec
30 min約7~8分~45 sec
1 hour~15 min約1.5分
2 hoursまず60分以下のパートに分割約2.5分

*Free times on a typical laptop with a WebGPU browser (Chrome/Edge); older devices without a GPU can be 2–4× slower. Free is capped at 60 minutes per file. Pro runs on cloud GPUs at the same speed on any device, using the larger large-v3 model for higher accuracy.

無料版の文字起こしを速くするには?

デバイスとブラウザによる速度 — 16分のファイルの場合

あなたの環境文字起こし時間(16分)
ノートPCまたはスマホ WebGPU対応 (Chrome、Edge、最新版Firefox)~4 min
スマホ、CPUのみ(WebGPUなし)約5~6分
Laptop WebGPUなし (Braveデフォルト、古いブラウザ)~8 min
古いノートPC、シングルコア動作最大約18分
どのデバイスでも Pro (クラウドGPU)~29 sec

Measured on our own benchmarks with the Whisper base model in-browser (large-v3-turbo for Pro). Your exact time varies with your device's chip and the audio itself.

無料、プライベートなAI音声&動画文字起こし — 仕組み

SnipSoundの文字起こしツールは、OpenAIのオープンソースの Whisper 音声認識モデルをWebAssembly経由でブラウザ内で完全に実行します。音声をここにドロップするだけです。 or 動画 — 動画から音声トラックを自動で抽出します。初めてクリックする際に Transcribe、あなたのブラウザが弊社のサーバーから約75MBのモデルファイルをダウンロードします。その後は、すべての文字起こしが完全にローカルで実行されます。あなたのファイルが、弊社、OpenAI、その他いかなるサーバーにもアップロードされることはありません。

特に動画を扱っていますか? 動画をテキストに字幕ファイルが必要なだけですか? SRTジェネレーター は、すぐに使える.srt/.vtt形式でエクスポートします。

こんな時に便利

文字起こしを編集 — 間違いを修正、検索&置換

自動文字起こしは完璧ではないため、文字起こしは完全に編集可能です。 ✎ Edit をクリックし、任意の行をクリックして聞き間違いを修正してください。変更は自動的に保存され、すべてのエクスポート(.txt、.srt、.vttなど)に反映されます。 Find を使って、ある単語が出現するすべての場所にジャンプし、 すべて置換 を使って、それを一度にすべて修正できます。これは、Whisperが間違って表記した名前、ブランド、用語(例:「Mark」をすべて「Marc」に修正するなど)を修正するのに最適です。マッチングは単語単位で行われるため、「a」を置換しても他の単語内の「a」には影響しません。生の出力がお好みですか?いつでも Original and Edited タブを切り替えてください — 未編集のオリジナルはファイルと一緒に保存されます。

苦手なこと

音声を英語に翻訳

「英語に翻訳」にチェックを入れると、Whisperは英語以外の音声を英語のテキストとして出力します。スペイン語のポッドキャスト → 英語の文字起こし。中国語のインタビュー → 英語のメモ。 音声翻訳専用ツールはこちら 翻訳が主な目的の場合。

99言語で音声を文字起こし

SnipSoundは音声を 99言語で文字起こしします。検索可能な言語選択機能と リアルな自動言語検出機能 — ほとんどのブラウザ内ツールでは不可能な、本格的な言語識別処理を実行します。クリアな音声であれば、英語、スペイン語、フランス語、ポルトガル語、イタリア語、ドイツ語、ロシア語、中国語、日本語を含む主要言語で特に高い精度を誇ります。 英語、スペイン語、フランス語、ポルトガル語、イタリア語、ドイツ語、ロシア語、中国語、日本語 — そのため、「transcribir audio a texto」、「transcrire audio en texte」、「trascrizione audio」、「音声文字起こし」など、様々な言語での文字起こしをブラウザで直接処理できます。

ご期待いただくために、いくつか正直な注意点があります。精度は clear 音声の場合です — 強いアクセントやノイズの多い音声は、どのオンデバイスモデルでも精度が低下します。また、一部のリソースが少ない言語(ヒンディー語/ウルドゥー語など)は無料モデルでは精度が低いため、言語選択機能では「精度限定」のマークが付いています。これらの言語では、Proモデルの方が優れています。 中国語と日本語では、文字起こしとキャプションは非常に優れています。単語ごとのクリック精度は、ラテン文字言語で最も優れています。主要言語のローカライズページは順次公開中です。または、ツールを開いて言語を選択するだけです(自動検出に任せることもできます)。

文字起こし以上の機能

音声認識を超えて、同じ無料ツールで 長いファイルを文字起こししながら読み上げ (ストリーミング結果)たり、 正確なキャプションのタイミングを維持したまま単語を編集したり、 most-said-words 分析を表示したり、単語の全ての出現箇所を見つけて再生したりできます。完了したら、ワンクリックであなたの 動画と単語ごとのタイムスタンプ付き文字起こしを、無料の 動画エディター タイムラインに文字起こしがすでに配置済みで、後でファイルを再度開くと、文字起こしがすぐに復元されます。

レビューモード 特に際立っているのは、AIが確信を持てなかった単語に下線を引く機能です。レビューボタンで、それらを一つずつ確認できます。 その単語の音声だけを再生 タップ一つで修正・保持ができ、あなたの判断は保存されます。他にも: 検索フィルター 文字起こしを一致する文章に絞り込み、波形上の位置を色分け表示します。 検索&一括置換 聞き間違いの名前を一度にすべて修正し(タイミングは維持)、編集 auto-save 再アップロード時に復元され、キャプション付き動画は元の動画のアスペクト比に合わせ、独自の再生コントロールを備えています。さらに、文章単位のタイムスタンプ付き全画面文字起こし表示もあります。

SnipSound対Otter.ai、Rev & Descript

SnipSoundは通常、有料のクラウド文字起こしサービス(例: Otter.ai, Rev and Descript。主な違いは、それらのサービスが音声をサーバーにアップロードし、月額課金または分単位の料金を請求するのに対し、SnipSoundは ブラウザで無料 何もアップロードされません。オプションのProプランのみ有料で、サブスクリプションなしの従量課金制です。

FeatureSnipSoundOtter.aiRevDescript
Cost無料 — Proは従量課金制、サブスクリプションなしフリーミアム、月額課金分単位課金 / サブスクリプション月額課金
あなたの音声ブラウザ内に留まる — アップロードなしサーバーにアップロードUploadedUploaded
アカウント必須NoneRequiredRequiredRequired
対応言語99FewerFewerFewer
単語レベルのタイムスタンプYesYesYesYes
キャプション付き動画を作成はい、内蔵NoNoはい(有料)
無料ファイル上限60分、ファイル数無制限無料時間制限トライアルのみ無料版(制限あり)

無料でプライベートな Otter.aiの代わり 音声をサードパーティサーバーに置きたくない方に。最も難しい音声には、 SnipSound プロ 最大のモデルをクラウドGPUで実行。使った分だけお支払いください。

精度はどのくらい?— Proはどんな時に役立つ?

クリアで単一話者の音声の場合、無料のブラウザ内モデル(OpenAIのWhisper base)は 非常に正確です。弊社のテストでは、英語とスペイン語は約100%、中国語と日本語は内容の正確性が約100%、フランス語は約88%でした。標準的なクリア音声ベンチマークでは、これはおよそ 95%; the Pro model (Whisper large-v3) is around 98%。しかし、背景ノイズ、音楽、強いアクセント、または話者の重なりがある実際の音声は、どのモデルにとっても難しく、そのため精度は低くなります — 99%の精度を謳うことはありません。

無料モデルが苦手なこと(Proが役立つ点)

言語(クリアな音声)ブラウザで使える無料モデル
英語、スペイン語~100%
中国語、日本語ほぼ100%内容が正確
French~88%
Hindi単語のタイミングは正確、無料版ではテキストが弱め — Pro版を推奨 Pro

英語、スペイン語、フランス語、ヒンディー語、中国語、日本語(非ラテン文字を含む)で、単語ごとに同期された字幕が検証済みです。すべての単語にタイミングが設定されており、98〜100%の音声カバー率です。「99言語」とは、モデルが対応する言語の数を示します。精度は言語や音声の品質によって異なり、クリアな音声の場合、無料版で約95%、Pro版で約98%の精度となります。

よくある質問

本当に無料ですか?
はい。アカウント登録もカード情報も不要で、利用制限もありません。文字起こしは、OpenAIのオープンソースモデル「Whisper」を使ってブラウザ内で実行されます。
音声ファイルはどこかにアップロードされますか?
いいえ。音声ファイルはブラウザ内に留まります。AIモデルは一度だけサーバーからダウンロードされ、ローカルにキャッシュされます。それ以降、文字起こしは完全にオフラインで実行されます。
対応言語は何ですか?
英語、スペイン語、北京語、ヒンディー語、アラビア語、フランス語、ポルトガル語、ロシア語、日本語、ドイツ語、韓国語、イタリア語など、99言語に対応しています。自動検出機能が最初の数秒で言語を特定します。
音声を英語に翻訳できますか?
はい。「英語に翻訳」にチェックを入れると、Whisperが英語以外の音声を英語のテキストとして出力します。または、専用の 音声翻訳ツール.
文字起こしの精度はどのくらいですか?
99言語のクリアな音声には非常に優れています。ただし、無料ツールはブラウザ内で軽量モデルを使用しているため、強いアクセント、BGM、話し手の重なり、ノイズの多い音声では精度が低下する場合があります。最も難しい音声には、 SnipSound プロ は、クラウドGPUで最高峰の大型モデルを実行し、最高の精度を実現します。月額課金ではなく従量課金制で、結果を編集することも可能です。いずれの場合も、無料ツールがファイルをアップロードすることはありません。
Otter、Rev、Descriptと比較してどうですか?
これらは、音声ファイルをサーバーにアップロードする有料のクラウドサービスです(月額約10~30ドル)。SnipSoundは、ブラウザ内で直接無料で文字起こしを行います。何もアップロードされず、アカウントも月額料金もファイルごとの時間制限もありません。難しい音声で最高レベルの精度が必要な場合は、 SnipSound プロ サブスクリプションではなく、従量課金制でクラウド上の最大モデルを実行します。
YouTube動画を文字起こしできますか?
はい。YouTube動画(または音声のみ)をダウンロードして、ここにファイルをドロップしてください。ブラウザ内でローカルに文字起こしを行い、.srt/.vttキャプションとしてエクスポートできます。YouTubeリンクから直接取得しないため、お客様のデータは確実にプライベートに保たれます。
文字起こしを編集できますか?
はい。「 ✎ Edit 」をクリックして任意の行を再入力するか、 すべて検索&置換 を使って、一度にすべての単語を修正できます。編集内容はすべてのエクスポート形式(.txt、.srt、.vtt)に反映されます。ほとんどの無料文字起こしツールは読み取り専用です。
動画の字幕を作成できますか?
はい。タイムスタンプ付きの.srtまたは.vttファイルをダウンロードできます。YouTube、Vimeo、ほとんどの動画編集ソフトで動作します。動画ファイルを直接ここにドロップすると、音声を自動的に抽出します。
長さの制限はありますか?
ファイルあたり60分まで。長いファイルはブラウザのRAMを過剰に消費します。当社の 音声トリマー を使うか、 オーディオスプリッター first.
1時間の音声ファイルを文字起こしするのにどれくらい時間がかかりますか?
ブラウザ内で、WebGPU対応ブラウザを搭載した一般的なノートパソコンで約15分です。無料でプライベート、Whisperのベースモデルを使用します。GPUのない古いデバイスでは遅くなる場合があります。With SnipSound プロ on cloud GPUs it's roughly 1.5 minutes, the same speed on any device, using the larger large-v3 model. (Measured on whisper-base in-browser vs whisper-large-v3-turbo on cloud GPUs.)
無料のブラウザベース文字起こしは正確ですか?
はい。99言語のクリアな音声には非常に優れており、Whisperのベースモデルをデバイス上で直接実行するため、何もアップロードされません。ただし、強いアクセント、BGM、話し手の重なりがある場合、精度が低下することがあります。where Pro's larger large-v3 model does better.
長いポッドキャストやインタビューを文字起こしする一番速い方法は?
無料のブラウザツールは動作し、プライバシーも保護されますが、処理時間はファイルの長さに応じて変動します(一般的なノートPCで1時間のファイルなら約15分)。また、1ファイルにつき60分までという制限があります。最速のオプションは SnipSound プロ、こちらはファイルの長さやデバイスに関わらず、クラウドGPUで約1〜2分で処理され、精度もさらに高くなります。
ブラウザやデバイスは文字起こしの速度に影響しますか?
はい、無料ツールはお使いのデバイスで動作します。対応ブラウザは WebGPU (Chrome、Edge、または最新版のFirefox)はGPUで動作するため、約 2倍の速さ WebGPUをデフォルトで無効にしているBraveのようなCPUのみのブラウザよりも高速です。16分のファイルの場合、WebGPUを使用すると約4分、CPUのみのノートPCでは約8分、古いシングルコアのPCでは最大約18分かかります。バッテリーセーバーによる速度低下を防ぐため、ノートPCは電源に接続したままにしてください。 Pro は、どのデバイスでもクラウドGPUで同じ速度で動作します(上記のファイルなら約29秒)。
単語レベルのタイムスタンプはありますか?
はい、すべての単語にタイミングが設定されています。文字起こしでは、各単語がハイライト表示され、 karaoke-style 音声の再生中に、任意の単語をクリックすると、その時点にジャンプできます。単語を検索すると、波形上にマークされます。タイミング情報は、.srtおよび.vtt形式のエクスポートファイルに保持されます。
音声を字幕付き動画にできますか?
はい、ワンクリックで文字起こしを 単語ごとの字幕付き動画 (大きなアニメーションテキスト)に変換できます。これはダウンロードして共有可能で、ポッドキャストのクリップやボイスメモを、編集なしでソーシャルビデオに変換するのに最適です。または、直接 ビデオエディター 単語同期キャプション付きで。
単語をピー音・検閲できますか?
はい、任意の単語(名前、スラング、その他何でも)を検索し、 すべての出現箇所をピー音で消去し、クリーンな音声をダウンロードできます。これは無料のブラウザ内ツールとしては珍しい機能です。専用の処理については、当社の 暴言除去ツール.