NO. 0011
هوش مصنوعی مدل‌های زبانی و معماری‌ها

مدل زبانی بزرگ LLM

Large Language Model (LLM)

مدل زبانی بزرگ یا LLM سامانه‌ای یادگیری‌ماشینی است که الگوهای زبان را از حجم زیادی متن می‌آموزد و بر اساس زمینه، واحدهای بعدی متن را پیش‌بینی می‌کند. توانایی تولید پاسخ شبیه فهم انسانی است، اما به معنی آگاهی، حافظهٔ واقعی یا درستی قطعی گفته‌ها نیست.

LLM چگونه متن تولید می‌کند؟

متن ابتدا به قطعه‌هایی به نام توکن تبدیل می‌شود. مدل با توجه به توکن‌های قبلی، احتمال توکن بعدی را محاسبه می‌کند و این فرایند مرحله‌به‌مرحله ادامه می‌یابد. خروجی از یک پایگاه پاسخ آماده برداشته نمی‌شود؛ در لحظه و بر پایهٔ وزن‌هایی ساخته می‌شود که هنگام آموزش آموخته شده‌اند.

بیشتر مدل‌های زبانی جدید از معماری Transformer استفاده می‌کنند. مقالهٔ پژوهشی Attention Is All You Need سازوکاری مبتنی بر توجه را معرفی کرد که رابطهٔ اجزای متن را بدون پردازش صرفاً ترتیبی بررسی می‌کند. «توجه» کمک می‌کند مدل هنگام تولید هر بخش، قسمت‌های مرتبط زمینه را وزن بیشتری بدهد.

آموزش، تنظیم و استنتاج چه فرقی دارند؟

مرحلهکار اصلینتیجه
پیش‌آموزشیادگیری الگوها از مجموعهٔ بزرگ متن و دادهتوان عمومی زبان و دانش آماری
پس‌آموزشتنظیم رفتاری با مثال، بازخورد و قواعد ایمنیپاسخ مفیدتر و پیروی بهتر از دستور
استنتاجپردازش ورودی کاربر با وزن‌های آموزش‌دیدهتولید پاسخ برای همان درخواست

مدل در گفت‌وگوی معمول هنگام پاسخ‌دادن دوباره آموزش نمی‌بیند. متن جاری در «پنجرهٔ زمینه» قرار می‌گیرد و رفتار همان پاسخ را شکل می‌دهد. حافظهٔ محصول، جست‌وجوی وب یا اتصال به فایل نیز قابلیت‌هایی پیرامون مدل‌اند و نباید با دانش درونی آن یکی دانسته شوند.

LLM چه کارهایی را خوب انجام می‌دهد؟

خلاصه‌سازی، بازنویسی، ترجمه، دسته‌بندی متن، استخراج ساختار، تولید پیش‌نویس، توضیح کد و پاسخ به پرسش از کاربردهای رایج‌اند. ارزش مدل زمانی بیشتر می‌شود که مسئله و معیار خروجی روشن باشد و ورودی کافی در اختیارش قرار گیرد.

برای پاسخ مبتنی بر اسناد داخلی می‌توان سامانه‌ای ساخت که ابتدا بخش‌های مرتبط را بازیابی و سپس همراه پرسش به مدل بدهد. این روش که معمولاً RAG نامیده می‌شود، با آموزش مجدد فرق دارد و امکان ارجاع به متن تازه را فراهم می‌کند. با این حال بازیابی نامناسب یا سند نادرست همچنان نتیجه را خراب می‌کند.

مدل چندوجهی ممکن است تصویر، صدا یا فایل را نیز دریافت کند، اما واژهٔ LLM در اصل به هستهٔ زبانی اشاره دارد. قابلیت دقیق هر محصول باید از مستندات همان نسخه بررسی شود.

توهم، سوگیری و محدودیت زمینه

چون هدف پایهٔ مدل ساخت ادامهٔ محتمل است، ممکن است نام، عدد، نقل‌قول یا منبعی قانع‌کننده اما ساختگی تولید کند؛ این خطا «توهم» نامیده می‌شود. درخواست «فقط حقیقت را بگو» خطر را صفر نمی‌کند. برای ادعای مهم باید منبع اصلی باز شود و داده با بیش از یک شاهد سنجیده شود.

  • تازگی: دانش مدل ممکن است رویدادهای جدید را پوشش ندهد مگر ابزار جست‌وجو داشته باشد.
  • سوگیری: الگوهای موجود در دادهٔ آموزشی می‌توانند در پاسخ بازتاب یابند.
  • زمینه: متن بسیار طولانی یا اطلاعات پنهان‌مانده از ورودی، برداشت ناقص می‌سازد.
  • عدم قطعیت: لحن مطمئن معیار اعتمادپذیری نیست.
  • حریم خصوصی: سیاست نگه‌داری داده به محصول و حساب وابسته است.

روش استفاده مسئولانه از مدل زبانی

کار را بر اساس ریسک تقسیم کنید. برای ایده‌پردازی کم‌خطر، بازبینی سبک کافی است؛ برای قرارداد، تشخیص پزشکی، تراکنش مالی یا تصمیم استخدامی باید متخصص مسئول خروجی باشد. اطلاعات شخصی و محرمانه را بدون مجوز و شناخت سیاست سرویس وارد نکنید.

در پرامپت منبع و تاریخ را مشخص کنید، از مدل بخواهید ابهام‌ها را اعلام کند و خروجی را به قالب قابل‌بررسی تبدیل کنید. سپس نمونه‌های واقعی را با معیار صحت، پوشش، لحن و ایمنی آزمایش کنید. مدل قوی با فرایند ضعیف همچنان خطای پرهزینه می‌سازد.

اصل مهم

LLM ابزار تولید و پردازش زبان است، نه مرجع مستقل حقیقت. مسئولیت استفاده از پاسخ به انسان یا سازمان استفاده‌کننده برمی‌گردد.

پرسش‌های متداول دربارهٔ مدل زبانی بزرگ LLM

آیا مدل زبانی بزرگ واقعاً می‌فهمد؟

مدل روابط پیچیدهٔ زبان را بازنمایی می‌کند و رفتاری شبیه فهم نشان می‌دهد، اما دربارهٔ آگاهی ذهنی آن نمی‌توان از روان‌بودن متن نتیجه گرفت. برای کاربرد عملی، توان و محدودیت قابل‌آزمون مهم‌تر است.

تفاوت LLM با چت‌بات چیست؟

LLM موتور تولید زبان است؛ چت‌بات یک محصول کامل با رابط گفت‌وگو، حافظه، ابزار، سیاست ایمنی و گاهی جست‌وجوست که ممکن است از LLM استفاده کند.

آیا هرچه مدل بزرگ‌تر باشد بهتر است؟

نه همیشه. کیفیت به داده، معماری، پس‌آموزش و نوع مسئله وابسته است. مدل کوچک‌تر می‌تواند برای کار محدود، سریع‌تر، ارزان‌تر و حتی دقیق‌تر باشد.