無料AI 音声&動画の文字起こし
SnipSoundの無料文字起こしツールを使えば、音声や動画を99言語のテキストに変換できます。ブラウザ上で直接、音声録音、ポッドキャスト、インタビュー、ボイスメモなどを手軽に文字起こししましょう。 単語レベルのタイムスタンプ カラオケ風ハイライト、 字幕付き動画の作成、単語のピー音処理、そして.txt、.srt、.vtt形式でのエクスポートが可能です。ファイルはデバイスから離れず、登録も不要です。
音声または動画ファイルをドロップ
またはクリックして参照。
ファイルをお持ちでないですか? 弊社のボイスレコーダーで録音する 文字起こしがどのように機能するかお試しください。
100%ブラウザで完結。 音声はあなたのデバイスに保存されます。Whisper AIモデル(約75MB)は弊社のサーバーから一度ダウンロードされ、その後はすべての文字起こしをローカルで実行します。音声があなたのコンピューターから離れることはないため、弊社がアクセスすることはありません。 プライバシーポリシー.
Transcript
ファイルの文字起こしにはどのくらい時間がかかりますか?
無料版は100%ブラウザで動作します — プライベート、無料、ほとんどのファイルに最適です。長いファイルや最高の精度が必要な場合は、Pro版がクラウドGPUで数秒で処理します。
無料版の落とし穴は?
いいえ、隠れたものはありません。これは本当に無料で、無制限、プライベートです。なぜなら、動作するのは お使いのデバイス 当社のサーバーではなく、お使いのデバイスで動作するため、当社が料金をいただく必要はありません。唯一のトレードオフは timeお使いのコンピューターはクラウドGPUほど高速ではないため、文字起こしに数分かかります。短いクリップならほとんど気になりません。しかし、 長いファイルでは 待ち時間がかさみます。そして、そのような場合にこそ Pro 真価を発揮します。クラウドGPUなら、同じ作業が数秒で、より高い精度で、どのデバイスでも可能です。
無料版とPro版 — 標準的な文字起こし時間
| ファイルの長さ | 無料版 — ブラウザで* | Pro版 — クラウド |
|---|---|---|
| 10 min | 約2~3分 | ~22 sec |
| 30 min | 約7~8分 | ~45 sec |
| 1 hour | ~15 min | 約1.5分 |
| 2 hours | まず60分以下のパートに分割 | 約2.5分 |
*Free times on a typical laptop with a WebGPU browser (Chrome/Edge); older devices without a GPU can be 2–4× slower. Free is capped at 60 minutes per file. Pro runs on cloud GPUs at the same speed on any device, using the larger large-v3 model for higher accuracy.
無料版の文字起こしを速くするには?
- WebGPUブラウザを使う — ChromeやEdge(および最新のFirefox)は、お使いのGPUで実行するため、およそ 2倍速く CPUのみのブラウザよりも動作します。BraveはデフォルトでWebGPUを無効にしています。
- ノートPCは電源に繋いだままに バッテリーセーバーモードはCPU/GPUの性能を抑え、処理時間がほぼ倍になることも。
- 他の重いタブやアプリは閉じる 文字起こしにはCPU/GPUとメモリを使います。空けておきましょう。
- GPU搭載デバイスは格段に速い WebGPU対応の新しいスマホやノートPCは、CPUのみの古いマシンより断然速いです(最新のスマホはGPUなしのノートPCより速いことも)。
- 初回のみモデルをダウンロード 一度だけお待ちください。それ以降の文字起こしではダウンロードは不要です。
デバイスとブラウザによる速度 — 16分のファイルの場合
| あなたの環境 | 文字起こし時間(16分) |
|---|---|
| ノートPCまたはスマホ WebGPU対応 (Chrome、Edge、最新版Firefox) | ~4 min |
| スマホ、CPUのみ(WebGPUなし) | 約5~6分 |
| Laptop WebGPUなし (Braveデフォルト、古いブラウザ) | ~8 min |
| 古いノートPC、シングルコア動作 | 最大約18分 |
| どのデバイスでも Pro (クラウドGPU) | ~29 sec |
Measured on our own benchmarks with the Whisper base model in-browser (large-v3-turbo for Pro). Your exact time varies with your device's chip and the audio itself.
無料、プライベートなAI音声&動画文字起こし — 仕組み
SnipSoundの文字起こしツールは、OpenAIのオープンソースの Whisper 音声認識モデルをWebAssembly経由でブラウザ内で完全に実行します。音声をここにドロップするだけです。 or 動画 — 動画から音声トラックを自動で抽出します。初めてクリックする際に Transcribe、あなたのブラウザが弊社のサーバーから約75MBのモデルファイルをダウンロードします。その後は、すべての文字起こしが完全にローカルで実行されます。あなたのファイルが、弊社、OpenAI、その他いかなるサーバーにもアップロードされることはありません。
特に動画を扱っていますか? 動画をテキストに字幕ファイルが必要なだけですか? SRTジェネレーター は、すぐに使える.srt/.vtt形式でエクスポートします。
こんな時に便利
- ポッドキャストのインタビュー、会議の録音、ボイスメモ、講義、その他明瞭な音声の文字起こし。
- 動画に字幕を追加 — 正確なタイムスタンプ付きの自動字幕を.srtおよび.vtt形式でダウンロード。YouTube、Vimeo、あらゆる編集ソフトで利用できます。
- ジャーナリスト、研究者、学生、クリエイター向けの、Otter、Rev、Descriptに代わる無料かつプライベートなツール — サブスクリプション不要、アップロード不要、ファイルごとの時間制限なし。
- 第三者のサーバーに置きたくないプライバシーに関わる音声 — 治療記録、機密性の高いインタビュー、社内会議など。
- 単語レベルのタイムスタンプ カラオケのように単語をハイライト表示し、クリックでジャンプ。正確な引用を抽出したり、精度の高いキャプションを作成したりできます。
- 音声を字幕付き動画に ワンクリックで、ポッドキャスト、ボイスメモ、SNS動画用の単語ごとの字幕動画を作成。ダウンロード・共有も可能です。
- 単語をピー音・検閲 任意の単語を検索して全ての出現箇所をミュートし、クリーンな音声をダウンロードできます(当社の 暴言除去ツール).
文字起こしを編集 — 間違いを修正、検索&置換
自動文字起こしは完璧ではないため、文字起こしは完全に編集可能です。 ✎ Edit をクリックし、任意の行をクリックして聞き間違いを修正してください。変更は自動的に保存され、すべてのエクスポート(.txt、.srt、.vttなど)に反映されます。 Find を使って、ある単語が出現するすべての場所にジャンプし、 すべて置換 を使って、それを一度にすべて修正できます。これは、Whisperが間違って表記した名前、ブランド、用語(例:「Mark」をすべて「Marc」に修正するなど)を修正するのに最適です。マッチングは単語単位で行われるため、「a」を置換しても他の単語内の「a」には影響しません。生の出力がお好みですか?いつでも Original and Edited タブを切り替えてください — 未編集のオリジナルはファイルと一緒に保存されます。
苦手なこと
- 大きな環境音、音声の背後にある音楽、複数の話者が重なっている場合 — tiny Whisperはこれらに苦戦します。
- 強いアクセントや一般的ではない方言 — より大きなWhisperモデルはこれらをより良く処理できますが、ブラウザには重すぎます。
- 話者分離(「誰が何を言ったか」) — Whisper-tinyではサポートされていません。
- 60分を超えるファイル — ブラウザのRAMを管理するため、入力長に制限を設けています。
音声を英語に翻訳
「英語に翻訳」にチェックを入れると、Whisperは英語以外の音声を英語のテキストとして出力します。スペイン語のポッドキャスト → 英語の文字起こし。中国語のインタビュー → 英語のメモ。 音声翻訳専用ツールはこちら 翻訳が主な目的の場合。
99言語で音声を文字起こし
SnipSoundは音声を 99言語で文字起こしします。検索可能な言語選択機能と リアルな自動言語検出機能 — ほとんどのブラウザ内ツールでは不可能な、本格的な言語識別処理を実行します。クリアな音声であれば、英語、スペイン語、フランス語、ポルトガル語、イタリア語、ドイツ語、ロシア語、中国語、日本語を含む主要言語で特に高い精度を誇ります。 英語、スペイン語、フランス語、ポルトガル語、イタリア語、ドイツ語、ロシア語、中国語、日本語 — そのため、「transcribir audio a texto」、「transcrire audio en texte」、「trascrizione audio」、「音声文字起こし」など、様々な言語での文字起こしをブラウザで直接処理できます。
ご期待いただくために、いくつか正直な注意点があります。精度は clear 音声の場合です — 強いアクセントやノイズの多い音声は、どのオンデバイスモデルでも精度が低下します。また、一部のリソースが少ない言語(ヒンディー語/ウルドゥー語など)は無料モデルでは精度が低いため、言語選択機能では「精度限定」のマークが付いています。これらの言語では、Proモデルの方が優れています。 中国語と日本語では、文字起こしとキャプションは非常に優れています。単語ごとのクリック精度は、ラテン文字言語で最も優れています。主要言語のローカライズページは順次公開中です。または、ツールを開いて言語を選択するだけです(自動検出に任せることもできます)。
文字起こし以上の機能
音声認識を超えて、同じ無料ツールで 長いファイルを文字起こししながら読み上げ (ストリーミング結果)たり、 正確なキャプションのタイミングを維持したまま単語を編集したり、 most-said-words 分析を表示したり、単語の全ての出現箇所を見つけて再生したりできます。完了したら、ワンクリックであなたの 動画と単語ごとのタイムスタンプ付き文字起こしを、無料の 動画エディター タイムラインに文字起こしがすでに配置済みで、後でファイルを再度開くと、文字起こしがすぐに復元されます。
レビューモード 特に際立っているのは、AIが確信を持てなかった単語に下線を引く機能です。レビューボタンで、それらを一つずつ確認できます。 その単語の音声だけを再生 タップ一つで修正・保持ができ、あなたの判断は保存されます。他にも: 検索フィルター 文字起こしを一致する文章に絞り込み、波形上の位置を色分け表示します。 検索&一括置換 聞き間違いの名前を一度にすべて修正し(タイミングは維持)、編集 auto-save 再アップロード時に復元され、キャプション付き動画は元の動画のアスペクト比に合わせ、独自の再生コントロールを備えています。さらに、文章単位のタイムスタンプ付き全画面文字起こし表示もあります。
SnipSound対Otter.ai、Rev & Descript
SnipSoundは通常、有料のクラウド文字起こしサービス(例: Otter.ai, Rev and Descript。主な違いは、それらのサービスが音声をサーバーにアップロードし、月額課金または分単位の料金を請求するのに対し、SnipSoundは ブラウザで無料 何もアップロードされません。オプションのProプランのみ有料で、サブスクリプションなしの従量課金制です。
| Feature | SnipSound | Otter.ai | Rev | Descript |
|---|---|---|---|---|
| Cost | 無料 — Proは従量課金制、サブスクリプションなし | フリーミアム、月額課金 | 分単位課金 / サブスクリプション | 月額課金 |
| あなたの音声 | ブラウザ内に留まる — アップロードなし | サーバーにアップロード | Uploaded | Uploaded |
| アカウント必須 | None | Required | Required | Required |
| 対応言語 | 99 | Fewer | Fewer | Fewer |
| 単語レベルのタイムスタンプ | Yes | Yes | Yes | Yes |
| キャプション付き動画を作成 | はい、内蔵 | No | No | はい(有料) |
| 無料ファイル上限 | 60分、ファイル数無制限 | 無料時間制限 | トライアルのみ | 無料版(制限あり) |
無料でプライベートな Otter.aiの代わり 音声をサードパーティサーバーに置きたくない方に。最も難しい音声には、 SnipSound プロ 最大のモデルをクラウドGPUで実行。使った分だけお支払いください。
精度はどのくらい?— Proはどんな時に役立つ?
クリアで単一話者の音声の場合、無料のブラウザ内モデル(OpenAIのWhisper base)は 非常に正確です。弊社のテストでは、英語とスペイン語は約100%、中国語と日本語は内容の正確性が約100%、フランス語は約88%でした。標準的なクリア音声ベンチマークでは、これはおよそ 95%; the Pro model (Whisper large-v3) is around 98%。しかし、背景ノイズ、音楽、強いアクセント、または話者の重なりがある実際の音声は、どのモデルにとっても難しく、そのため精度は低くなります — 99%の精度を謳うことはありません。
無料モデルが苦手なこと(Proが役立つ点)
- 強いアクセント、固有名詞、人名、専門用語、略語 — 小さな無料モデルは、珍しい単語を聞き間違えることが多く、Proのより大きなモデルは、それらをより正確に認識します。
- 音声に重なるBGMやノイズ、そして話者の重なり — どちらもブラウザサイズのモデルには難しく、どちらのモデルも誰が何を言ったかを識別しません。
- 一部の言語 無料モデルは、主要なヨーロッパ言語に加え、中国語と日本語には優れていますが、他の言語では精度が落ちます。例えば、 Hindi 無料モデルでは、関連するウルドゥー語の表記で問題が再発することがあります。 ウルドゥー語の表記 発音のずれが生じることがあります。ヒンディー語とウルドゥー語は同じ話し言葉ですが、これは小規模モデルの既知の制限です。その 単語のタイミングは正確です。テキストの精度が落ちます。Pro版のより大規模なモデルは、ヒンディー語やその他の難しい言語をはるかにうまく処理できます。
| 言語(クリアな音声) | ブラウザで使える無料モデル |
|---|---|
| 英語、スペイン語 | ~100% |
| 中国語、日本語 | ほぼ100%内容が正確 |
| French | ~88% |
| Hindi | 単語のタイミングは正確、無料版ではテキストが弱め — Pro版を推奨 Pro |
英語、スペイン語、フランス語、ヒンディー語、中国語、日本語(非ラテン文字を含む)で、単語ごとに同期された字幕が検証済みです。すべての単語にタイミングが設定されており、98〜100%の音声カバー率です。「99言語」とは、モデルが対応する言語の数を示します。精度は言語や音声の品質によって異なり、クリアな音声の場合、無料版で約95%、Pro版で約98%の精度となります。