Document Extraction
Document Extraction
ابدأ بالمعنى، ثم انتقل إلى التفاصيل.
هذا الدرس يشرح Document Extraction ضمن موضوع استخدام Hermes وفهم سلوكه. ستعرف ما الذي يفعله هذا الجزء، متى تحتاجه، وما أصغر خطوة آمنة للتأكد أنه يعمل.
إن كنت جديدًا: لا تحفظ الأسماء. ركّز على ثلاثة أسئلة: ما المشكلة التي يحلها هذا الجزء؟ ما البيانات أو الصلاحيات التي يحتاجها؟ وكيف أعرف أن النتيجة صحيحة؟
للتطبيق: اقرأ المثال الأول، حدّد ما سيغيّره، نفّذه على بيانات تجريبية، ثم قارن الناتج بما وعد به المصدر.
للمتخصص: راجع Supported formats، Scanned PDFs: the coverage warning، ثم افحص حالات الفشل والتوافق مع إصدارك.
ابدأ من صفحة التثبيت إذا لم تشغّل Hermes بعد.
نتيجة واضحة قبل أن تقرأ.
- تفهم Document Extraction من دون افتراض معرفة سابقة.
- تفرّق بين الوصف والمعلومة التي تحتاج إلى اختبار في بيئتك.
- اقرأ الأمر الأول وحدد المدخلات والمخرجات قبل نسخه.
How read_file converts PDFs, Office documents, and notebooks to text — and what to do when a PDF is scanned images
ما الذي يقوله المصدر، وبأي ترتيب؟
- 01Supported formats
ابدأ بهذا القسم لتفهم الفكرة أو البنية الأساسية.
- 02Scanned PDFs: the coverage warning
اختم بهذا القسم لتفحص النتيجة والحالات الخاصة.
انسخ بعد أن تفهم الأثر.
[EXTRACTION COVERAGE WARNING: 198 of 311 pages in this PDF yielded no
text. ... Unreadable gaps, each labeled with the last text extracted
before it:
pages 42-77 (36 pages) — after "Antigua Maintenance Corp Bylaws" (p41)
pages 92-213 (122 pages) — after "... Covenants, Codes and Regulations" (p91)
page 224 (1 page) — after "... Insurance Declaration Pages" (p223)
Decide which gaps you actually need — do NOT OCR or render everything. ...]pdftoppm -jpeg -r 150 -f 92 -l 94 document.pdf /tmp/pageاقرأ الأمر الأول وحدد المدخلات والمخرجات قبل نسخه.
طابق أي أمر مع إصدار Hermes المثبّت، وراجع الملفات والحسابات التي قد يصل إليها، واستخدم بيانات غير حساسة في أول اختبار. إذا اختلف الشرح عن المصدر، فالمصدر الرسمي هو المرجع النهائي.