PDF إلى Markdown — استخرج النص للملاحظات في المتصفح
استخرج نص PDF إلى Markdown في المتصفح للملاحظات أو LLM — الملف يبقى على جهازك ولا يُرفع إلى خادم. الخطوات: اختر PDF بطبقة نص، تحويل، معاينة، ثم تنزيل .md. مثال: عينة صفحة واحدة تنتج .md يحتوي «Hello PDF to Markdown sample.» الممسوح ضوئيًا بدون OCR يفشل. الملفات المشفرة تظهر خطأ واضح.
كيف يعمل
اختر PDF، تحويل، راجع المعاينة، ثم تنزيل .md. تُجمّع الأسطر حسب الموضع الرأسي؛ الصفحات تفصل بـ ---. كل شيء محلي بعد تحميل المكتبات.
قواعد متوقعة
استخراج طبقة النص، فاصل الصفحات، بلا OCR، الخصوصية والفشل.
- المحرك: getTextContent لكل صفحة؛ عناصر y متقاربة → سطر بمسافات.
- الصفحات: فارغ + --- + فارغ بين الصفحات.
- بلا OCR: إن كان النص بعد trim فارغًا → فشل واضح.
- الحدود: البايتات في التبويب؛ مشفر/تالف يفشل بوضوح؛ >~25 MB قد يبطئ.
مثال
العينة تنشئ PDF صفحة واحدة بخط Helvetica، تحوّله، تعرض الجملة في المعاينة، وتفعّل تنزيل .md.
حالات مناسبة
- مكتب: انسخ بنود العقود للملاحظات دون إعادة كتابة.
- كتّاب وذكاء اصطناعي: صدّر تقارير Markdown للتحرير أو المطالبات.
- طلاب: نص محاضرات من PDF بطبقة نص — للمراجعة.
Frequently asked questions
هل يُرفع PDF؟
لا. مُصيّر الصفحات يعمل في تبويبك (قد تُحمّل السكربتات من CDN). PDF لا يُرفع إلى خوادمنا.
لماذا يفشل PDF الممسوح؟
الممسوح غالبًا صور بلا طبقة نص. بلا OCR يبقى الاستخراج فارغًا مع رسالة واضحة.
هل يحافظ على العناوين أو الجداول؟
لا يعيد بناء العناوين أو الجداول — نص عادي مجمّع حسب الموضع.
ما الفرق عن Markdown إلى HTML؟
Markdown إلى HTML يحوّل صيغة Markdown لمعاينة ويب. هذه الأداة تصدّر نص PDF إلى .md.
متى أستخدم PDF إلى JPG؟
PDF إلى JPG يعرض كل صفحة كصورة. استخدم هذه الأداة عند الحاجة لنص قابل للتحرير.
استفسارات أو ملاحظات
هل هناك غموض أو خلل أو نقص؟ اكتب رسالة أدناه — نقرأ كل ملاحظة عن هذه الأدوات.