الأكاديمية ← استخدام Hermesتوثيق رسمي · شرح عربي واضح

Tensorrt Llm — High-throughput LLM inference on NVIDIA GPUs

Tensorrt Llm — High-throughput LLM inference on NVIDIA GPUs

مبتدئ9 دقيقة3 أسئلة2026-08-09
الفكرة في دقيقة

ابدأ بالمعنى، ثم انتقل إلى التفاصيل.

هذا الدرس يشرح Tensorrt Llm — High-throughput LLM inference on NVIDIA GPUs ضمن موضوع بدء استخدام Hermes بصورة صحيحة. ستعرف ما الذي يفعله هذا الجزء، متى تحتاجه، وما أصغر خطوة آمنة للتأكد أنه يعمل.

إن كنت مبتدئًا

إن كنت جديدًا: لا تحفظ الأسماء. ركّز على ثلاثة أسئلة: ما المشكلة التي يحلها هذا الجزء؟ ما البيانات أو الصلاحيات التي يحتاجها؟ وكيف أعرف أن النتيجة صحيحة؟

للتطبيق العملي

للتطبيق: اقرأ المثال الأول، حدّد ما سيغيّره، نفّذه على بيانات تجريبية، ثم قارن الناتج بما وعد به المصدر.

للمتخصص

للمتخصص: راجع Skill metadata، Reference: full SKILL.md، When to use TensorRT-LLM، ثم افحص حالات الفشل والتوافق مع إصدارك.

ما الذي تحتاجه قبل البدء؟

لا تحتاج خبرة سابقة؛ اتبع الخطوات على جهاز تجريبي أولًا.

ماذا ستعرف؟

نتيجة واضحة قبل أن تقرأ.

  • تفهم Tensorrt Llm — High-throughput LLM inference on NVIDIA GPUs من دون افتراض معرفة سابقة.
  • تفرّق بين الوصف والمعلومة التي تحتاج إلى اختبار في بيئتك.
  • اقرأ الأمر الأول وحدد المدخلات والمخرجات قبل نسخه.
مصطلحات هذا الدرس

تعريفات قصيرة قبل التفاصيل.

Skill
حزمة تعليمات تعلّم Hermes طريقة عمل متكررة من دون إضافة خدمة خارجية بالضرورة.
وصف الصفحة الرسمي

High-throughput LLM inference on NVIDIA GPUs

خريطة الموضوع

ما الذي يقوله المصدر، وبأي ترتيب؟

  1. 01
    Skill metadata

    ابدأ بهذا القسم لتفهم الفكرة أو البنية الأساسية.

  2. 02
    Reference: full SKILL.md

    اقرأه بعد الأساسيات، ثم اربطه بالخطوة السابقة قبل المتابعة.

  3. 03
    When to use TensorRT-LLM

    اقرأه بعد الأساسيات، ثم اربطه بالخطوة السابقة قبل المتابعة.

  4. 04
    Quick start

    اقرأه بعد الأساسيات، ثم اربطه بالخطوة السابقة قبل المتابعة.

  5. 05
    Installation

    اقرأه بعد الأساسيات، ثم اربطه بالخطوة السابقة قبل المتابعة.

  6. 06
    Basic inference

    اقرأه بعد الأساسيات، ثم اربطه بالخطوة السابقة قبل المتابعة.

  7. 07
    Serving with trtllm-serve

    اقرأه بعد الأساسيات، ثم اربطه بالخطوة السابقة قبل المتابعة.

  8. 08
    Key features

    اقرأه بعد الأساسيات، ثم اربطه بالخطوة السابقة قبل المتابعة.

  9. 09
    Performance optimizations

    اقرأه بعد الأساسيات، ثم اربطه بالخطوة السابقة قبل المتابعة.

  10. 10
    Parallelism

    اختم بهذا القسم لتفحص النتيجة والحالات الخاصة.

أمثلة من الصفحة الرسمية

انسخ بعد أن تفهم الأثر.

# Docker (recommended) — images are on NGC (nvcr.io), not Docker Hub. # Replace x.y.z with the desired version (e.g. 1.2.1). Browse tags on NGC: # https://catalog.ngc.nvidia.com/orgs/nvidia/teams/tensorrt-llm/containers/release/tags docker pull nvcr.io/nvidia/tensorrt-llm/release:x.y.z # pip install (current stable GA) pip install tensorrt_llm # Requires CUDA 13.2.1, TensorRT 10.x, Python 3.10-3.12
### Serving with trtllm-serve
## Key features ### Performance optimizations - **In-flight batching**: Dynamic batching during generation - **Paged KV cache**: Efficient memory management - **Flash Attention**: Optimized attention kernels - **Quantization**: FP8, INT4, FP4 for 2-4× faster inference - **CUDA graphs**: Reduced kernel launch overhead ### Parallelism - **Tensor parallelism (TP)**: Split model across GPUs - **Pipeline parallelism (PP)**: Layer-wise distribution - **Expert parallelism**: For Mixture-of-Experts models - **Multi-node**: Scale beyond single machine ### Advanced features - **Speculative decoding**
تطبيق الآن

اقرأ الأمر الأول وحدد المدخلات والمخرجات قبل نسخه.

طابق أي أمر مع إصدار Hermes المثبّت، وراجع الملفات والحسابات التي قد يصل إليها، واستخدم بيانات غير حساسة في أول اختبار. إذا اختلف الشرح عن المصدر، فالمصدر الرسمي هو المرجع النهائي.

اختبار الفهم

ثلاثة قرارات قبل علامة الاكتمال.

1. ما المرجع النهائي عند تغيّر معلومات «شرح Tensorrt Llm — High-throughput LLM inference on NVIDIA GPUs»؟
2. ما أفضل طريقة لتطبيق هذا الدرس؟
3. ماذا تفعل قبل خطوة قد تعدّل ملفات أو حسابًا خارجيًا؟