ذكاء اصطناعي مجاني تفريغ الصوت والفيديو
أداة SnipSound المجانية للتفريغ الصوتي تحول الصوت أو الفيديو إلى نص بـ 99 لغة، مباشرة في متصفحك — حوّل تسجيلًا صوتيًا، بودكاست، مقابلة أو مذكرة صوتية إلى نص (قم بتفريغ الصوت إلى نص، أو تحويل الصوت المنطوق إلى نص). احصل على طوابع زمنية على مستوى الكلمة مع تمييز بأسلوب الكاريوكي، أنشئ فيديو مترجم، أخفِ أي كلمة، وصدّر بصيغ .txt، .srt، أو .vtt. ملفاتك لا تغادر جهازك أبدًا. لا يلزم تسجيل.
اسحب ملفاً صوتياً أو مرئياً
أو انقر للتصفح.
ليس لديك ملف؟ سجّل واحداً باستخدام مسجل الصوت الخاص بنا لاختبار كيفية عمل التفريغ.
100% في متصفحك. يبقى الصوت على جهازك. يتم تنزيل نموذج Whisper AI مرة واحدة (حوالي 75 ميجابايت) من خوادمنا، ثم يعمل محليًا لكل عملية نسخ. لا يمكننا الوصول إلى صوتك لأنه لا يغادر جهاز الكمبيوتر الخاص بك أبدًا. سياسة الخصوصية.
Transcript
كم سيستغرق ملفك للنسخ؟
النسخة المجانية تعمل 100% في متصفحك — خاصة، 0$، رائعة لمعظم الملفات. للملفات الطويلة أو الدقة القصوى، تعمل نسخة Pro على وحدات معالجة الرسوميات السحابية في ثوانٍ.
ما السر في المجاني؟
لا يوجد سر خفي — إنه مجاني حقًا، وغير محدود، وخاص، لأنه يعمل على جهازك الخاص بدلاً من خوادمنا، لذلك لا يوجد ما نفرض عليه رسومًا. المقايضة الوحيدة هي time: جهازك ليس بسرعة وحدة معالجة الرسوميات السحابية (GPU)، لذلك يستغرق النسخ بضع دقائق. بالنسبة للمقاطع القصيرة، هذا بالكاد ملحوظ. أما لـ الملفات الطويلة يزداد وقت الانتظار — وهذه هي الحالة الوحيدة التي Pro يثبت جدارته: نفس المهمة على وحدات معالجة الرسوميات السحابية (GPUs) في ثوانٍ، بدقة أعلى، وعلى أي جهاز.
المجاني مقابل الاحترافي — أوقات النسخ المعتادة
| طول الملف | مجاني — في متصفحك* | احترافي — سحابي |
|---|---|---|
| 10 min | حوالي 2-3 دقائق | ~22 sec |
| 30 min | حوالي 7-8 دقائق | ~45 sec |
| 1 hour | ~15 min | حوالي 1.5 دقيقة |
| 2 hours | مقسمة إلى أجزاء لا تتجاوز 60 دقيقة أولاً | حوالي 2.5 دقيقة |
*Free times on a typical laptop with a WebGPU browser (Chrome/Edge); older devices without a GPU can be 2–4× slower. Free is capped at 60 minutes per file. Pro runs on cloud GPUs at the same speed on any device, using the larger large-v3 model for higher accuracy.
ما الذي يجعل النسخ المجاني أسرع؟
- استخدم متصفح WebGPU — كروم أو إيدج (وأحدث إصدار من فايرفوكس) يشغلونه على وحدة معالجة الرسوميات (GPU) الخاصة بك، تقريبًا أسرع بمرتين من متصفح يعتمد على وحدة المعالجة المركزية (CPU) فقط. متصفح Brave يعطل WebGPU افتراضيًا.
- ابقِ حاسوبك موصولاً بالشاحن — وضع توفير البطارية يحد من أداء CPU/GPU وقد يضاعف الوقت تقريباً.
- أغلق علامات التبويب والتطبيقات الأخرى الثقيلة — النسخ يستخدم CPU/GPU والذاكرة؛ حررهما.
- الجهاز المزود بـ GPU أسرع بكثير — هاتف أو حاسوب محمول حديث مزود بـ WebGPU يتفوق بفارق كبير على جهاز قديم يعتمد على CPU فقط (حتى الهاتف الحديث يمكن أن يتفوق على حاسوب محمول بدون GPU).
- التشغيل الأول يحمل النموذج مرة واحدة — انتظار لمرة واحدة؛ كل عملية نسخ بعدها تتخطاه.
السرعة حسب الجهاز & المتصفح — ملف مدته 16 دقيقة
| إعداداتك | وقت النسخ (16 دقيقة) |
|---|---|
| حاسوب محمول أو هاتف مع WebGPU (كروم، إيدج، فايرفوكس الأحدث) | ~4 min |
| هاتف، CPU فقط (بدون WebGPU) | ~5–6 دقائق |
| Laptop بدون WebGPU (براف الافتراضي، متصفح أقدم) | ~8 min |
| حاسوب محمول قديم، يعتمد على نواة واحدة | حتى ~18 دقيقة |
| أي جهاز مزود بـ Pro (GPU سحابية) | ~29 sec |
Measured on our own benchmarks with the Whisper base model in-browser (large-v3-turbo for Pro). Your exact time varies with your device's chip and the audio itself.
نسخ صوت & فيديو بالذكاء الاصطناعي مجاني وخاص — كيف يعمل
أداة النسخ في SnipSound تستخدم نموذج OpenAI مفتوح المصدر Whisper للتعرف على الكلام الذي يعمل بالكامل في متصفحك عبر WebAssembly. اسحب الصوت or فيديو — للفيديو، نستخرج المسار الصوتي تلقائيًا. في المرة الأولى التي تنقر فيها Transcribe، يقوم متصفحك بتنزيل ملف نموذج بحجم ~75 ميجابايت من خوادمنا؛ بعد ذلك، تكون كل عملية نسخ محلية بالكامل. ملفك لا يُرفع أبدًا إلى أي خادم — لا خوادمنا، ولا خوادم OpenAI، ولا خوادم أي جهة أخرى.
هل تعمل مع الفيديو تحديدًا؟ جرّب فيديو إلى نص. هل تحتاج فقط إلى ملف ترجمة؟ الـ مولّد SRT يُصدّر ملفات .srt/.vtt جاهزة للاستخدام.
ما الذي يُجيده
- تفريغ مقابلات البودكاست، تسجيلات الاجتماعات، المذكرات الصوتية، المحاضرات، أو أي صوت بكلام واضح.
- إضافة ترجمات مصاحبة للفيديو — أنشئ ترجمات تلقائية بصيغتي .srt و .vtt قابلة للتنزيل، مع طوابع زمنية دقيقة يمكن إدراجها في يوتيوب، فيميو، أو أي محرر.
- بديل مجاني وخاص لـ Otter و Rev و Descript للصحفيين والباحثين والطلاب والمبدعين — لا اشتراك، لا رفع ملفات، ولا حد زمني لكل ملف.
- صوت حساس للخصوصية لا ترغب بوجوده على خادم طرف ثالث — ملاحظات العلاج، مقابلات سرية، اجتماعات داخلية.
- طوابع زمنية على مستوى الكلمة — تمييز الكلمات بأسلوب الكاريوكي والنقر للانتقال، لتتمكن من استخراج اقتباس دقيق أو إنشاء تسميات توضيحية دقيقة.
- حوّل الصوت إلى فيديو مع تسميات توضيحية — فيديو تسميات توضيحية كلمة بكلمة بنقرة واحدة للبودكاست والملاحظات الصوتية ومقاطع التواصل الاجتماعي، قابل للتنزيل والمشاركة.
- حجب الكلمات — ابحث عن أي كلمة واكتم كل ظهور لها، ثم نزّل الصوت النظيف (يتكامل مع أداة إزالة الألفاظ النابية).
تعديل التفريغ النصي — تصحيح الأخطاء، بحث & استبدال
التفريغ التلقائي ليس مثاليًا أبدًا، لذا فإن التفريغ النصي قابل للتعديل بالكامل. انقر ✎ Edit وانقر على أي سطر لإعادة كتابة كلمة أُسيء فهمها — يتم حفظ تغييراتك تلقائيًا وتظهر في كل عملية تصدير (.txt، .srt، .vtt، والبقية). استخدم Find للانتقال إلى كل مكان تظهر فيه الكلمة، و استبدال الكل لإصلاحها في كل مكان دفعة واحدة — مثالي لتصحيح اسم أو علامة تجارية أو مصطلح أخطأ Whisper في تهجئته في جميع أنحاء النص (على سبيل المثال، كل "Mark" ← "Marc"). المطابقة تكون لكلمة كاملة، لذا فإن استبدال "a" لن يؤثر على الحرف "a" داخل الكلمات الأخرى. هل تفضل الإخراج الخام؟ تنقّل بين Original and Edited علامات التبويب في أي وقت — يبقى الأصل غير المعدّل محفوظًا مع الملف.
ما الذي لا يُجيده
- ضوضاء خلفية عالية، موسيقى خلف الصوت، أو عدة متحدثين متداخلين — Whisper الصغير يواجه صعوبة في هذه الحالات.
- لهجات ثقيلة أو لهجات غير سائدة — نماذج Whisper الأكبر تتعامل مع هذه الحالات بشكل أفضل لكنها ثقيلة جدًا على المتصفح.
- تمييز المتحدثين ("من قال ماذا") — غير مدعوم بواسطة Whisper-tiny.
- ملفات أطول من 60 دقيقة — نحدد طول الإدخال للحفاظ على ذاكرة الوصول العشوائي للمتصفح تحت السيطرة.
ترجمة الصوت إلى الإنجليزية
ضع علامة في مربع "Translate to English" ويقوم Whisper بتحويل أي صوت غير إنجليزي إلى نص إنجليزي. بودكاست إسباني ← تفريغ إنجليزي. مقابلة بالماندرين ← ملاحظات إنجليزية. أداة ترجمة صوتية مخصصة هنا إذا كانت الترجمة هي حاجتك الأساسية.
انسخ الصوت بـ 99 لغة
SnipSound ينسخ الكلام بـ 99 لغة، مع أداة اختيار لغة قابلة للبحث و كشف تلقائي حقيقي للغة — فهو يجري عملية تحديد لغة حقيقية، وهو ما لا تستطيع معظم الأدوات داخل المتصفح فعله. في الكلام الواضح، تكون الدقة قوية عبر اللغات الرئيسية بما في ذلك الإنجليزية والإسبانية والفرنسية والبرتغالية والإيطالية والألمانية والروسية والصينية واليابانية — لذا فهو يتعامل مع "transcribir audio a texto" و "transcrire audio en texte" و "trascrizione audio" و "音声文字起こし" والمزيد، مباشرة في متصفحك.
بعض الملاحظات الصادقة لتعرف ما تتوقعه: أرقام الدقة هي لـ clear الكلام — اللهجات الثقيلة أو الصوت المشوش تقلل الدقة في أي نموذج يعمل على الجهاز — وبعض اللغات ذات الموارد المنخفضة (الهندية/الأردية من بينها) تكون أضعف في النموذج المجاني، وهذا هو السبب في أن أداة اختيار اللغة تحدد مستوى دقة محدودًا لها؛ بالنسبة لتلك اللغات، يقدم نموذج Pro أداءً أفضل. لـ الصينية واليابانية، النسخ والتسميات التوضيحية ممتازة؛ دقة النقر كلمة بكلمة تكون أقوى في اللغات ذات الأبجدية اللاتينية. الصفحات المترجمة للغات الرئيسية قيد الإطلاق — أو ببساطة افتح الأداة واختر لغتك (أو دع الكشف التلقائي يقوم بذلك).
أكثر من مجرد نص منسوخ
أبعد من تحويل الكلام إلى نص، الأداة المجانية نفسها تقرأ الملفات الطويلة بصوت عالٍ أثناء نسخها (نتائج متدفقة)، تتيح لك تعديل كلمة مع الحفاظ على توقيت التسمية التوضيحية الدقيق لها، وتعرض most-said-words تحليلًا، وتجد وتشغل كل ظهور لكلمة. عندما تنتهي، نقرة واحدة ترسل فيديو مع نص متزامن بالكلمة مباشرة إلى محرر الفيديو المجاني محرر الفيديو مع تسميات توضيحية موجودة مسبقًا على المخطط الزمني — وإعادة فتح الملف لاحقًا يستعيد نصه المكتوب فورًا.
وضع المراجعة الميزة الأبرز هي: يضع الذكاء الاصطناعي خطًا تحت الكلمات التي يشك في دقتها، وزرّ المراجعة يأخذك خلالها واحدة تلو الأخرى. مع إعادة تشغيل صوت تلك الكلمة فقط حتى تتمكن من الاحتفاظ بها أو إصلاحها بنقرة واحدة — ويتم حفظ قراراتك. وهناك المزيد: فلاتر البحث النص المكتوب لإظهار الجمل المتطابقة ويظلل مكانها على شكل الموجة الصوتية، بحث & استبدال الكل يصلح اسمًا سُمع خطأً في كل مكان دفعة واحدة (مع الحفاظ على التوقيتات)، تعديلات auto-save واستعادة عند إعادة الرفع، يتطابق فيديو التسميات التوضيحية مع نسبة أبعاد مصدرك مع أدوات التحكم الخاصة به في التشغيل، وهناك عرض نص مكتوب بملء الشاشة مع طوابع زمنية على مستوى الجملة.
SnipSound مقابل Otter.ai, Rev & Descript
عادةً ما يقارن الناس SnipSound بأدوات النسخ السحابية المدفوعة مثل Otter.ai, Rev and Descript. الفرق الجوهري: تلك الأدوات ترفع صوتك إلى خوادمها وتفرض اشتراكًا شهريًا أو رسومًا لكل دقيقة، بينما يعمل SnipSound مجانًا في متصفحك دون رفع أي شيء — فقط الفئة الاحترافية الاختيارية هي التي تكلف شيئًا، وهي بنظام الدفع حسب الاستخدام بدون اشتراك.
| Feature | SnipSound | Otter.ai | Rev | Descript |
|---|---|---|---|---|
| Cost | مجاني — Pro بنظام الدفع حسب الاستخدام، بدون اشتراك | فريميوم، مدفوع شهريًا | مدفوع بالدقيقة / اشتراك | مدفوع شهريًا |
| صوتك | يبقى في متصفحك — لا يُرفع أبدًا | يُرفع إلى خوادمهم | Uploaded | Uploaded |
| يتطلب حسابًا | None | Required | Required | Required |
| اللغات (دعم النماذج) | 99 | Fewer | Fewer | Fewer |
| طوابع زمنية على مستوى الكلمة | Yes | Yes | Yes | Yes |
| أنشئ فيديو مع ترجمة | نعم، مدمج | No | No | نعم (مدفوع) |
| حد مجاني للملف الواحد | 60 دقيقة، ملفات غير محدودة | دقائق مجانية محدودة | للتجربة فقط | مجاني بحدود |
أداة مجانية وخاصة بديل لـ Otter.ai لأي شخص لا يريد أن تكون ملفاته الصوتية على خادم طرف ثالث. أما بالنسبة للملفات الصوتية الأكثر صعوبة، SnipSound برو يشغل أكبر نموذج على GPUs السحابية، والدفع حسب الاستخدام.
ما مدى دقته — ومتى يستحق إصدار Pro العناء؟
في الملفات الصوتية الواضحة ذات المتحدث الواحد، النموذج المجاني الذي يعمل في المتصفح (نموذج Whisper الأساسي من OpenAI) يكون دقيقًا جدًا. في اختباراتنا الخاصة، جاءت الإنجليزية والإسبانية بدقة حوالي 100%، والصينية واليابانية بدقة محتوى حوالي 100%، والفرنسية حوالي 88%. على معيار قياسي للكلام الواضح، هذا يعادل تقريبًا 95%; the Pro model (Whisper large-v3) is around 98%. الملفات الصوتية الواقعية التي تحتوي على ضوضاء خلفية أو موسيقى أو لهجات قوية أو متحدثين متداخلين تكون أصعب على أي نموذج، لذا تكون الدقة فيها أقل — نحن لا ندعي أبدًا دقة 99%.
ما يواجهه النموذج المجاني من صعوبات (وأين يساعد إصدار Pro)
- اللهجات القوية، الأسماء العلم، الأسماء، المصطلحات المتخصصة، والاختصارات — النموذج المجاني الأصغر يسيء فهم الكلمات النادرة في كثير من الأحيان؛ بينما النموذج الأكبر في Pro يتعرف عليها بشكل صحيح في معظم الأوقات.
- الموسيقى الخلفية أو الضوضاء تحت الصوت، والمتحدثون المتداخلون — كلاهما صعب على نموذج بحجم المتصفح، ولا يقوم أي من النموذجين بتحديد من قال ماذا.
- بعض اللغات. النموذج المجاني ممتاز للغات الأوروبية الرئيسية بالإضافة إلى الصينية واليابانية، لكنه أضعف في لغات أخرى. على سبيل المثال، Hindi على النموذج المجاني، قد تعود الأخطاء للظهور في النص الأردي ذي الصلة. النص الأردي مع الانجراف الصوتي — الهندية والأردية هما نفس اللغة المنطوقة، وهذا قيد معروف للنموذج الأصغر. الـ توقيت الكلمات يبقى دقيقًا؛ النص هو الذي يتأثر. النموذج الأكبر لـ Pro يتعامل مع الهندية واللغات الأخرى الأكثر صعوبة بشكل أفضل بكثير.
| اللغة (كلام واضح) | نموذج مجاني داخل المتصفح |
|---|---|
| الإنجليزية، الإسبانية | ~100% |
| الصينية، اليابانية | دقيق المحتوى بنسبة 100% تقريبًا |
| French | ~88% |
| Hindi | توقيت الكلمات دقيق؛ النص أضعف في النموذج المجاني — استخدم Pro |
تم التحقق من التسميات التوضيحية المتزامنة مع الكلمات عبر الإنجليزية والإسبانية والفرنسية والهندية والصينية واليابانية (بما في ذلك النصوص غير اللاتينية) — كل كلمة موقوتة، تغطية صوتية بنسبة 98-100%. يشير "99 لغة" إلى دعم النموذج للغات؛ وتختلف الدقة حسب اللغة وجودة الصوت، والنموذج المجاني يقدم دقة ~95% / Pro ~98% على الكلام الواضح.