اشتر لي قهوة
الذكاء الاصطناعي

مفرّغ الصوت والفيديو

فرّغ الصوت أو الفيديو إلى نص وأنشئ ترجمات SRT/VTT عبر نموذج Whisper على جهازك. مجاني وخاص وبدون رفع. يعمل على جهازك — لا يُرفع شيء ولا يُخزَّن شيء.

يشغّل نموذج Whisper من OpenAI بالكامل داخل متصفحك عبر WebGPU (مع احتياطي WASM). يُنزّل النموذج مرة واحدة من شبكة توصيل المحتوى عند أول استخدام، ثم يُفرّغ على جهازك — ولا يُرفَع صوتك أبداً.

حول Audio/Video Transcriber

تحوّل أداة «تفريغ الصوت والفيديو» تسجيلًا إلى نص على جهازك أنت. أسقط ملف MP3 أو WAV أو M4A أو OGG أو MP4 أو WebM، فتنتج نصًا كاملًا ومقاطع موقّتة يمكنك تصديرها ترجماتٍ بصيغة SRT أو VTT، أو نصًا عاديًا.

التعرّف على الكلام يجري بنموذج Whisper — تحديدًا النسخة base — عبر Transformers.js داخل المتصفح. في أول استخدام تُنزَّل ملفات النموذج وتُحفظ مؤقتًا، ثم يُعاد استخدامها بعد ذلك. أما الصوت نفسه فيُفكّ ترميزه إلى قناة واحدة بتردد 16 كيلوهرتز داخل الصفحة، ويُمرَّر إلى النموذج في مقاطع من ثلاثين ثانية بتداخل خمس ثوانٍ حتى لا تضيع الكلمات الواقعة عند حدود المقاطع.

لا مفتاح واجهة برمجة، ولا رسوم بالدقيقة، ولا رفع للتسجيل.

لماذا تعمل هذه الأداة على جهازك

هذه هي الأداة التي تغيّر فيها المعالجة على الجهاز ما يُسمح لك بفعله فعلًا. فالتسجيلات التي يريد الناس تفريغها هي جلسات علاج نفسي، وإملاء طبي، وتحقيقات موارد بشرية، وإفادات قانونية، ومقابلات صحفيين مع مصادر وُعدت بالسرية، ومكالمات داخلية للشركة. وإرسال أي منها إلى خدمة تفريغ مستضافة يعني نسخة على بنية طرف آخر، تحكمها سياسة احتفاظ وشروط لم تقرأها على الأرجح — وفي عدة مهن يمثّل ذلك وحده مخالفة امتثال مهما وعد المزوّد. هنا لا يغادر الصوت التبويب أبدًا. النموذج هو الذي ينتقل إلى تسجيلك، لا تسجيلك الذي ينتقل إلى النموذج.

كيفية استخدام Audio/Video Transcriber
  1. أسقط ملف صوت أو فيديو.
  2. اضغط «تفريغ» — التشغيل الأول ينزّل نموذج Whisper مع شريط تقدّم.
  3. انتظر ظهور النص والمقاطع الموقّتة.
  4. انسخ النص أو نزّله بصيغة TXT أو SRT أو VTT.
الحدود والمقايضات
  • تشغّل الأداة نموذج Whisper base، وهو الطرف الصغير من العائلة. أما الخدمة المستضافة فتشغّل شبه المؤكد نموذجًا أكبر بكثير، والفارق ظاهر: توقّع أخطاء أكثر مع اللهجات الثقيلة والضجيج الخلفي وتداخل الأصوات وأسماء الأعلام والمصطلحات التقنية. ولا توجد تسميات للمتحدثين — فالمتحدثون المتداخلون يخرجون تيارًا نصيًا واحدًا غير مميَّز.
  • التشغيل الأول ينزّل النموذج من شبكة توصيل محتوى. صوتك لا يُرفع، لكن الأداة غير صالحة للعمل دون اتصال حتى تُحفَظ تلك الملفات، وعلى وصلة بطيئة يكون الانتظار قبل بدء التفريغ ملموسًا.
  • السرعة تعتمد كليًا على عتادك. فمع متصفح يدعم WebGPU تكون سريعة إلى حد معقول، أما الرجوع إلى WebAssembly فقد يكون أبطأ من الزمن الحقيقي، أي أن ساعة صوت قد تستغرق أكثر من ساعة. ولا يوجد مؤشر تقدّم أثناء التفريغ نفسه ولا طريقة لإلغائه — فالتقدّم يظهر لتنزيل النموذج فقط.
  • يُفكّ ترميز الملف كاملًا في الذاكرة قبل بدء التفريغ، لذا قد تستنفد التسجيلات الطويلة ذاكرة التبويب على جهاز متواضع. ولا يوجد أيضًا اختيار للغة ولا وضع ترجمة — يكتشف Whisper اللغة بنفسه ولا يمكنك تجاوز ذلك — كما أن توقيتات المقاطع تقريبية، فتحتاج الترجمات عادةً إلى ضبط في محرّر ترجمات قبل الاستخدام.
الأسئلة الشائعة