Free Audio Transcription

ذكاء اصطناعي مجاني تفريغ الصوت والفيديو

أداة SnipSound المجانية للتفريغ الصوتي تحول الصوت أو الفيديو إلى نص بـ 99 لغة، مباشرة في متصفحك — حوّل تسجيلًا صوتيًا، بودكاست، مقابلة أو مذكرة صوتية إلى نص (قم بتفريغ الصوت إلى نص، أو تحويل الصوت المنطوق إلى نص). احصل على طوابع زمنية على مستوى الكلمة مع تمييز بأسلوب الكاريوكي، أنشئ فيديو مترجم، أخفِ أي كلمة، وصدّر بصيغ .txt، .srt، أو .vtt. ملفاتك لا تغادر جهازك أبدًا. لا يلزم تسجيل.

ليس لديك ملف جاهز؟

اسحب ملفاً صوتياً أو مرئياً

أو انقر للتصفح.

MP3WAVOGGFLACAACM4AWEBMMP4MOV

ليس لديك ملف؟ سجّل واحداً باستخدام مسجل الصوت الخاص بنا لاختبار كيفية عمل التفريغ.

100% في متصفحك. يبقى الصوت على جهازك. يتم تنزيل نموذج Whisper AI مرة واحدة (حوالي 75 ميجابايت) من خوادمنا، ثم يعمل محليًا لكل عملية نسخ. لا يمكننا الوصول إلى صوتك لأنه لا يغادر جهاز الكمبيوتر الخاص بك أبدًا. سياسة الخصوصية.

file.mp3
ما هي لغة الصوت؟
جارٍ تحميل النموذج… 0%

Transcript

خيارات التصدير:

كم سيستغرق ملفك للنسخ؟

النسخة المجانية تعمل 100% في متصفحك — خاصة، 0$، رائعة لمعظم الملفات. للملفات الطويلة أو الدقة القصوى، تعمل نسخة Pro على وحدات معالجة الرسوميات السحابية في ثوانٍ.

16 min
📁 لملء هذا تلقائيًا
● مجاني · في متصفحك
خاص 100% · 0$
◆ برو · سحابي
Fastest · larger large-v3 model
جارٍ الكشف عن جهازك…
Estimates from our own benchmarks (Whisper base in-browser vs large-v3-turbo on cloud GPUs). Free scales with your device; Pro is the same speed on any device.

ما السر في المجاني؟

لا يوجد سر خفي — إنه مجاني حقًا، وغير محدود، وخاص، لأنه يعمل على جهازك الخاص بدلاً من خوادمنا، لذلك لا يوجد ما نفرض عليه رسومًا. المقايضة الوحيدة هي time: جهازك ليس بسرعة وحدة معالجة الرسوميات السحابية (GPU)، لذلك يستغرق النسخ بضع دقائق. بالنسبة للمقاطع القصيرة، هذا بالكاد ملحوظ. أما لـ الملفات الطويلة يزداد وقت الانتظار — وهذه هي الحالة الوحيدة التي Pro يثبت جدارته: نفس المهمة على وحدات معالجة الرسوميات السحابية (GPUs) في ثوانٍ، بدقة أعلى، وعلى أي جهاز.

المجاني مقابل الاحترافي — أوقات النسخ المعتادة

طول الملفمجاني — في متصفحك*احترافي — سحابي
10 minحوالي 2-3 دقائق~22 sec
30 minحوالي 7-8 دقائق~45 sec
1 hour~15 minحوالي 1.5 دقيقة
2 hoursمقسمة إلى أجزاء لا تتجاوز 60 دقيقة أولاًحوالي 2.5 دقيقة

*Free times on a typical laptop with a WebGPU browser (Chrome/Edge); older devices without a GPU can be 2–4× slower. Free is capped at 60 minutes per file. Pro runs on cloud GPUs at the same speed on any device, using the larger large-v3 model for higher accuracy.

ما الذي يجعل النسخ المجاني أسرع؟

السرعة حسب الجهاز & المتصفح — ملف مدته 16 دقيقة

إعداداتكوقت النسخ (16 دقيقة)
حاسوب محمول أو هاتف مع WebGPU (كروم، إيدج، فايرفوكس الأحدث)~4 min
هاتف، CPU فقط (بدون WebGPU)~5–6 دقائق
Laptop بدون WebGPU (براف الافتراضي، متصفح أقدم)~8 min
حاسوب محمول قديم، يعتمد على نواة واحدةحتى ~18 دقيقة
أي جهاز مزود بـ Pro (GPU سحابية)~29 sec

Measured on our own benchmarks with the Whisper base model in-browser (large-v3-turbo for Pro). Your exact time varies with your device's chip and the audio itself.

نسخ صوت & فيديو بالذكاء الاصطناعي مجاني وخاص — كيف يعمل

أداة النسخ في SnipSound تستخدم نموذج OpenAI مفتوح المصدر Whisper للتعرف على الكلام الذي يعمل بالكامل في متصفحك عبر WebAssembly. اسحب الصوت or فيديو — للفيديو، نستخرج المسار الصوتي تلقائيًا. في المرة الأولى التي تنقر فيها Transcribe، يقوم متصفحك بتنزيل ملف نموذج بحجم ~75 ميجابايت من خوادمنا؛ بعد ذلك، تكون كل عملية نسخ محلية بالكامل. ملفك لا يُرفع أبدًا إلى أي خادم — لا خوادمنا، ولا خوادم OpenAI، ولا خوادم أي جهة أخرى.

هل تعمل مع الفيديو تحديدًا؟ جرّب فيديو إلى نص. هل تحتاج فقط إلى ملف ترجمة؟ الـ مولّد SRT يُصدّر ملفات .srt/.vtt جاهزة للاستخدام.

ما الذي يُجيده

تعديل التفريغ النصي — تصحيح الأخطاء، بحث & استبدال

التفريغ التلقائي ليس مثاليًا أبدًا، لذا فإن التفريغ النصي قابل للتعديل بالكامل. انقر ✎ Edit وانقر على أي سطر لإعادة كتابة كلمة أُسيء فهمها — يتم حفظ تغييراتك تلقائيًا وتظهر في كل عملية تصدير (.txt، .srt، .vtt، والبقية). استخدم Find للانتقال إلى كل مكان تظهر فيه الكلمة، و استبدال الكل لإصلاحها في كل مكان دفعة واحدة — مثالي لتصحيح اسم أو علامة تجارية أو مصطلح أخطأ Whisper في تهجئته في جميع أنحاء النص (على سبيل المثال، كل "Mark" ← "Marc"). المطابقة تكون لكلمة كاملة، لذا فإن استبدال "a" لن يؤثر على الحرف "a" داخل الكلمات الأخرى. هل تفضل الإخراج الخام؟ تنقّل بين Original and Edited علامات التبويب في أي وقت — يبقى الأصل غير المعدّل محفوظًا مع الملف.

ما الذي لا يُجيده

ترجمة الصوت إلى الإنجليزية

ضع علامة في مربع "Translate to English" ويقوم Whisper بتحويل أي صوت غير إنجليزي إلى نص إنجليزي. بودكاست إسباني ← تفريغ إنجليزي. مقابلة بالماندرين ← ملاحظات إنجليزية. أداة ترجمة صوتية مخصصة هنا إذا كانت الترجمة هي حاجتك الأساسية.

انسخ الصوت بـ 99 لغة

SnipSound ينسخ الكلام بـ 99 لغة، مع أداة اختيار لغة قابلة للبحث و كشف تلقائي حقيقي للغة — فهو يجري عملية تحديد لغة حقيقية، وهو ما لا تستطيع معظم الأدوات داخل المتصفح فعله. في الكلام الواضح، تكون الدقة قوية عبر اللغات الرئيسية بما في ذلك الإنجليزية والإسبانية والفرنسية والبرتغالية والإيطالية والألمانية والروسية والصينية واليابانية — لذا فهو يتعامل مع "transcribir audio a texto" و "transcrire audio en texte" و "trascrizione audio" و "音声文字起こし" والمزيد، مباشرة في متصفحك.

بعض الملاحظات الصادقة لتعرف ما تتوقعه: أرقام الدقة هي لـ clear الكلام — اللهجات الثقيلة أو الصوت المشوش تقلل الدقة في أي نموذج يعمل على الجهاز — وبعض اللغات ذات الموارد المنخفضة (الهندية/الأردية من بينها) تكون أضعف في النموذج المجاني، وهذا هو السبب في أن أداة اختيار اللغة تحدد مستوى دقة محدودًا لها؛ بالنسبة لتلك اللغات، يقدم نموذج Pro أداءً أفضل. لـ الصينية واليابانية، النسخ والتسميات التوضيحية ممتازة؛ دقة النقر كلمة بكلمة تكون أقوى في اللغات ذات الأبجدية اللاتينية. الصفحات المترجمة للغات الرئيسية قيد الإطلاق — أو ببساطة افتح الأداة واختر لغتك (أو دع الكشف التلقائي يقوم بذلك).

أكثر من مجرد نص منسوخ

أبعد من تحويل الكلام إلى نص، الأداة المجانية نفسها تقرأ الملفات الطويلة بصوت عالٍ أثناء نسخها (نتائج متدفقة)، تتيح لك تعديل كلمة مع الحفاظ على توقيت التسمية التوضيحية الدقيق لها، وتعرض most-said-words تحليلًا، وتجد وتشغل كل ظهور لكلمة. عندما تنتهي، نقرة واحدة ترسل فيديو مع نص متزامن بالكلمة مباشرة إلى محرر الفيديو المجاني محرر الفيديو مع تسميات توضيحية موجودة مسبقًا على المخطط الزمني — وإعادة فتح الملف لاحقًا يستعيد نصه المكتوب فورًا.

وضع المراجعة الميزة الأبرز هي: يضع الذكاء الاصطناعي خطًا تحت الكلمات التي يشك في دقتها، وزرّ المراجعة يأخذك خلالها واحدة تلو الأخرى. مع إعادة تشغيل صوت تلك الكلمة فقط حتى تتمكن من الاحتفاظ بها أو إصلاحها بنقرة واحدة — ويتم حفظ قراراتك. وهناك المزيد: فلاتر البحث النص المكتوب لإظهار الجمل المتطابقة ويظلل مكانها على شكل الموجة الصوتية، بحث & استبدال الكل يصلح اسمًا سُمع خطأً في كل مكان دفعة واحدة (مع الحفاظ على التوقيتات)، تعديلات auto-save واستعادة عند إعادة الرفع، يتطابق فيديو التسميات التوضيحية مع نسبة أبعاد مصدرك مع أدوات التحكم الخاصة به في التشغيل، وهناك عرض نص مكتوب بملء الشاشة مع طوابع زمنية على مستوى الجملة.

SnipSound مقابل Otter.ai, Rev & Descript

عادةً ما يقارن الناس SnipSound بأدوات النسخ السحابية المدفوعة مثل Otter.ai, Rev and Descript. الفرق الجوهري: تلك الأدوات ترفع صوتك إلى خوادمها وتفرض اشتراكًا شهريًا أو رسومًا لكل دقيقة، بينما يعمل SnipSound مجانًا في متصفحك دون رفع أي شيء — فقط الفئة الاحترافية الاختيارية هي التي تكلف شيئًا، وهي بنظام الدفع حسب الاستخدام بدون اشتراك.

FeatureSnipSoundOtter.aiRevDescript
Costمجاني — Pro بنظام الدفع حسب الاستخدام، بدون اشتراكفريميوم، مدفوع شهريًامدفوع بالدقيقة / اشتراكمدفوع شهريًا
صوتكيبقى في متصفحك — لا يُرفع أبدًايُرفع إلى خوادمهمUploadedUploaded
يتطلب حسابًاNoneRequiredRequiredRequired
اللغات (دعم النماذج)99FewerFewerFewer
طوابع زمنية على مستوى الكلمةYesYesYesYes
أنشئ فيديو مع ترجمةنعم، مدمجNoNoنعم (مدفوع)
حد مجاني للملف الواحد60 دقيقة، ملفات غير محدودةدقائق مجانية محدودةللتجربة فقطمجاني بحدود

أداة مجانية وخاصة بديل لـ Otter.ai لأي شخص لا يريد أن تكون ملفاته الصوتية على خادم طرف ثالث. أما بالنسبة للملفات الصوتية الأكثر صعوبة، SnipSound برو يشغل أكبر نموذج على GPUs السحابية، والدفع حسب الاستخدام.

ما مدى دقته — ومتى يستحق إصدار Pro العناء؟

في الملفات الصوتية الواضحة ذات المتحدث الواحد، النموذج المجاني الذي يعمل في المتصفح (نموذج Whisper الأساسي من OpenAI) يكون دقيقًا جدًا. في اختباراتنا الخاصة، جاءت الإنجليزية والإسبانية بدقة حوالي 100%، والصينية واليابانية بدقة محتوى حوالي 100%، والفرنسية حوالي 88%. على معيار قياسي للكلام الواضح، هذا يعادل تقريبًا 95%; the Pro model (Whisper large-v3) is around 98%. الملفات الصوتية الواقعية التي تحتوي على ضوضاء خلفية أو موسيقى أو لهجات قوية أو متحدثين متداخلين تكون أصعب على أي نموذج، لذا تكون الدقة فيها أقل — نحن لا ندعي أبدًا دقة 99%.

ما يواجهه النموذج المجاني من صعوبات (وأين يساعد إصدار Pro)

اللغة (كلام واضح)نموذج مجاني داخل المتصفح
الإنجليزية، الإسبانية~100%
الصينية، اليابانيةدقيق المحتوى بنسبة 100% تقريبًا
French~88%
Hindiتوقيت الكلمات دقيق؛ النص أضعف في النموذج المجاني — استخدم Pro

تم التحقق من التسميات التوضيحية المتزامنة مع الكلمات عبر الإنجليزية والإسبانية والفرنسية والهندية والصينية واليابانية (بما في ذلك النصوص غير اللاتينية) — كل كلمة موقوتة، تغطية صوتية بنسبة 98-100%. يشير "99 لغة" إلى دعم النموذج للغات؛ وتختلف الدقة حسب اللغة وجودة الصوت، والنموذج المجاني يقدم دقة ~95% / Pro ~98% على الكلام الواضح.

الأسئلة الشائعة

هل هذا مجاني حقاً؟
نعم. لا حساب، لا بطاقة، ولا حدود للاستخدام. يتم النسخ في متصفحك باستخدام نموذج Whisper مفتوح المصدر من OpenAI.
هل يتم رفع ملفي الصوتي إلى أي مكان؟
لا. يبقى ملفك الصوتي في متصفحك. يتم تنزيل نموذج الذكاء الاصطناعي من خوادمنا مرة واحدة وتخزينه مؤقتًا محليًا — بعد ذلك، يكون النسخ غير متصل بالإنترنت بالكامل.
ما هي اللغات المدعومة؟
99 لغة، بما في ذلك الإنجليزية، الإسبانية، الماندرين، الهندية، العربية، الفرنسية، البرتغالية، الروسية، اليابانية، الألمانية، الكورية، الإيطالية، وغيرها الكثير. الكشف التلقائي يختار من الثواني القليلة الأولى.
هل يمكنه ترجمة الصوت إلى الإنجليزية؟
نعم. ضع علامة صح على "الترجمة إلى الإنجليزية" وسيقوم Whisper بتحويل أي صوت غير إنجليزي إلى نص إنجليزي. أو استخدم الأداة المخصصة مترجم الصوت.
ما مدى دقة النسخ؟
جيد جدًا للكلام الواضح عبر 99 لغة. قد تنخفض الدقة مع اللهجات الثقيلة، الموسيقى الخلفية، المتحدثين المتداخلين، أو الصوت الصاخب، لأن الأداة المجانية تشغل نموذجًا أخف في متصفحك. للصوت الأكثر صعوبة، SnipSound برو يشغل النموذج الكبير الأفضل على وحدات معالجة الرسوميات السحابية لأعلى دقة — الدفع حسب الاستخدام، لا اشتراك شهري — ولا يزال بإمكانك تعديل النتيجة. في كلتا الحالتين، لا تقوم الأداة المجانية أبدًا برفع ملفك.
كيف تقارن هذه الأداة بـ Otter، Rev، أو Descript؟
هذه خدمات سحابية مدفوعة (حوالي 10-30 دولارًا شهريًا) تقوم برفع صوتك إلى خوادمها. SnipSound ينسخ مجانًا، مباشرة في متصفحك — لا يتم رفع أي شيء، لا حساب، لا رسوم شهرية، ولا حد زمني لكل ملف. عندما تحتاج إلى دقة عالية المستوى للصوت الصعب، SnipSound برو يشغل النموذج الأكبر في السحابة على أساس الدفع حسب الاستخدام بدلاً من الاشتراك.
هل يمكنني نسخ فيديو يوتيوب؟
نعم. قم بتنزيل فيديو YouTube (أو صوته فقط) وأسقط الملف هنا — نقوم بنسخه محليًا في متصفحك ويمكنك تصدير تسميات توضيحية بصيغة .srt/.vtt. نحن لا نسحب من روابط YouTube مباشرة، وهذا بالضبط ما يحافظ على خصوصية بياناتك.
هل يمكنني تعديل النص المنسوخ؟
نعم — انقر ✎ Edit وأعد كتابة أي سطر، أو استخدم بحث واستبدال الكل لتصحيح كلمة في كل مكان دفعة واحدة. التعديلات تظهر في كل عملية تصدير (.txt, .srt, .vtt). معظم أدوات النسخ المجانية للقراءة فقط.
هل يمكنني الحصول على ترجمة فيديو؟
نعم — قم بتنزيل .srt أو .vtt مع الطوابع الزمنية. يعمل في YouTube، Vimeo، ومعظم برامج تحرير الفيديو. أسقط ملف الفيديو الخاص بك مباشرة هنا — نستخرج الصوت تلقائيًا.
هل يوجد حد للطول؟
60 دقيقة لكل ملف. الملفات الأطول تستهلك الكثير من ذاكرة الوصول العشوائي للمتصفح. قم بالقص باستخدام أداة قص الصوت أو قم بالتقسيم باستخدام أداة تقسيم الصوت first.
كم يستغرق نسخ ملف صوتي مدته ساعة واحدة؟
في متصفحك، حوالي 15 دقيقة على جهاز كمبيوتر محمول عادي مزود بمتصفح يدعم WebGPU — مجاني، خاص، باستخدام نموذج Whisper الأساسي. الأجهزة القديمة التي لا تحتوي على وحدة معالجة رسوميات قد تكون أبطأ. مع SnipSound برو on cloud GPUs it's roughly 1.5 minutes, the same speed on any device, using the larger large-v3 model. (Measured on whisper-base in-browser vs whisper-large-v3-turbo on cloud GPUs.)
هل النسخ المجاني القائم على المتصفح دقيق؟
نعم — جيد جدًا للكلام الواضح عبر 99 لغة، يشغل نموذج Whisper الأساسي مباشرة على جهازك دون رفع أي شيء. قد تنخفض الدقة مع اللهجات الثقيلة، الموسيقى الخلفية، أو المتحدثين المتداخلين، حيث Pro's larger large-v3 model does better.
ما هي أسرع طريقة لتفريغ بودكاست أو مقابلة طويلة؟
تعمل الأداة المجانية في المتصفح وتحافظ على خصوصيتك، لكن وقت معالجتها يتناسب مع طول الملف (حوالي 15 دقيقة لملف مدته ساعة على جهاز كمبيوتر محمول عادي)، والحد الأقصى للملف الواحد هو 60 دقيقة. الخيار الأسرع هو SnipSound برو، الذي يعالج ملفك على وحدات معالجة الرسوميات السحابية (GPUs) في حوالي 1-2 دقيقة بغض النظر عن طول الملف أو نوع الجهاز، وبدقة أعلى.
هل يؤثر متصفحي أو جهازي على سرعة التفريغ؟
نعم، الأداة المجانية تعمل على جهازك الخاص. متصفح يدعم WebGPU (كروم، إيدج، أو أحدث إصدار من فايرفوكس) يعمل باستخدام وحدة معالجة الرسوميات (GPU) الخاصة بجهازك ويكون أسرع بحوالي الضعف مقارنة بمتصفح يعتمد على المعالج المركزي فقط مثل Brave (الذي يعطل WebGPU افتراضيًا). يستغرق ملف مدته 16 دقيقة حوالي 4 دقائق باستخدام WebGPU، وحوالي 8 دقائق على جهاز كمبيوتر محمول يعتمد على المعالج المركزي فقط، وما يصل إلى 18 دقيقة على جهاز قديم أحادي النواة. حافظ على توصيل الكمبيوتر المحمول بالشاحن لتجنب تباطؤ الأداء بسبب وضع توفير البطارية. Pro يعمل على وحدات معالجة الرسوميات السحابية (GPUs) بنفس السرعة على أي جهاز (حوالي 29 ثانية لذلك الملف).
هل يوفر طوابع زمنية على مستوى الكلمة؟
نعم — كل كلمة موقوتة. يبرز النص كل كلمة karaoke-style أثناء تشغيل الصوت، ويمكنك النقر على أي كلمة للانتقال إلى تلك اللحظة. ابحث عن كلمة وسيتم تحديدها على شكل الموجة الصوتية. يتم الاحتفاظ بالتوقيت في صادراتك بصيغتي .srt و .vtt.
هل يمكنني تحويل صوتي إلى فيديو مترجم؟
نعم — بنقرة واحدة، يتحول نصك إلى فيديو مع تسميات توضيحية كلمة بكلمة (نص متحرك كبير) يمكنك تنزيله ومشاركته، رائع لتحويل مقطع بودكاست أو مذكرة صوتية إلى فيديو اجتماعي بدون تحرير. أو أرسله مباشرة إلى محرر الفيديو مع تسميات توضيحية متزامنة مع الكلمات.
هل يمكنني إخفاء أو حجب كلمة؟
نعم — ابحث عن أي كلمة (اسم، كلمة بذيئة، أي شيء)، قم بتشويش كل ظهور، وقم بتنزيل الصوت النظيف. نادر بالنسبة لأداة مجانية داخل المتصفح. لمعالجة متخصصة، راجع إزالة الألفاظ النابية.