NO. 0010
هوش مصنوعی مفاهیم پایه هوش مصنوعی

هوش مصنوعی چندوجهی

Multimodal AI

هوش مصنوعی چندوجهی به مدل‌هایی گفته می‌شود که می‌توانند بیش از یک نوع داده را هم‌زمان پردازش کنند — مثلاً متن و تصویر و صدا با هم. تفاوت مهم با کنار هم گذاشتن چند مدل جداگانه این است که مدل چندوجهی این نوع‌ها را در یک فضای معنایی مشترک نمایش می‌دهد و می‌تواند میانشان ارتباط برقرار کند.

«وجه» یعنی چه؟

«وجه» یا Modality یعنی نوع یا کانال داده. هر کدام از این‌ها یک وجه جداگانه‌اند: متن، تصویر ثابت، ویدیو، صدا، گفتار، داده‌های حسگر، داده‌های جدولی و حتی حرکت.

انسان ذاتاً چندوجهی عمل می‌کند. وقتی کسی با لحن تند می‌گوید «خیلی ممنون»، شما معنی را از ترکیب کلمات، لحن صدا و حالت چهره استخراج می‌کنید. هیچ‌کدام از این سه به‌تنهایی معنی درست را نمی‌رساند. مدل چندوجهی تلاش می‌کند همین توانایی ترکیب را بازتولید کند.

تمایز مهم

سامانه‌ای که ابتدا صدا را با یک مدل به متن تبدیل می‌کند و بعد متن را به یک مدل زبانی می‌دهد، چندوجهی واقعی نیست؛ یک زنجیرهٔ تک‌وجهی است. در این زنجیره، لحن و مکث و احساس در گام اول از بین می‌رود. مدل چندوجهی واقعی، صدا را مستقیماً پردازش می‌کند و این نشانه‌ها را حفظ می‌کند.

چطور کار می‌کند؟ ایدهٔ فضای مشترک

هستهٔ فنی این فناوری، مفهومی به نام فضای بردار مشترک است. منطقش را می‌توان در سه گام توضیح داد:

  1. هر وجه، رمزگذار خودش را دارد. یک شبکه تصویر را به دنبالهٔ اعداد تبدیل می‌کند، شبکهٔ دیگری همین کار را با متن می‌کند.
  2. خروجی‌ها به یک فضای واحد نگاشت می‌شوند. مدل طوری آموزش می‌بیند که بردار عکس یک گربه، در این فضا نزدیک بردار عبارت «یک گربه» قرار بگیرد و دور از بردار «یک هواپیما».
  3. پردازش مشترک. حالا که همه‌چیز به زبان مشترک اعداد ترجمه شده، مدل می‌تواند دربارهٔ ترکیب آن‌ها استدلال کند.

روش رایج آموزش، استفاده از حجم عظیمی از جفت‌های تصویر و متن توضیحی است که به‌طور طبیعی در وب وجود دارند. مدل یاد می‌گیرد کدام تصویر به کدام توضیح تعلق دارد و در همین فرایند، نگاشت مشترک شکل می‌گیرد.

چه کارهایی ممکن می‌شود؟

  • پرسش دربارهٔ تصویر. عکسی از تابلوی برق می‌فرستید و می‌پرسید کدام فیوز پریده است.
  • جست‌وجوی معنایی در رسانه. در آرشیو ویدیو با عبارت «لحظه‌ای که ماشین قرمز از چراغ رد شد» جست‌وجو کنید، بدون آنکه کسی برچسبی زده باشد.
  • خواندن اسناد پیچیده. فهم فاکتور، نمودار و فرم — جایی که معنی از ترکیب متن و جای قرارگرفتن آن روی صفحه می‌آید.
  • دسترس‌پذیری. توصیف خودکار تصویر برای نابینایان، و تبدیل زبان اشاره به متن.
  • تولید بین‌وجهی. ساخت تصویر از متن، ساخت موسیقی از توصیف، یا تولید توضیح صوتی برای ویدیو.
  • تشخیص پزشکی کمکی. ترکیب تصویر رادیولوژی با شرح‌حال متنی بیمار و نتایج آزمایش.

الگوی مشترک همهٔ این‌ها این است: معنا در ترکیب وجه‌هاست، نه در هیچ‌کدام به‌تنهایی.

محدودیت‌های خاص این نوع مدل‌ها

مدل‌های چندوجهی علاوه بر مشکلات عمومی هوش مصنوعی، ضعف‌های ویژهٔ خود را دارند:

  • توهم بصری. مدل ممکن است شیئی را در تصویر «ببیند» که وجود ندارد، چون در دادهٔ آموزشی معمولاً کنار اشیای دیگرِ حاضر در صحنه ظاهر شده است.
  • ضعف در استدلال فضایی و شمارش. پرسش‌هایی مثل «چند نفر در تصویر هستند» یا «کدام جسم سمت چپ دیگری است» به‌طور شگفت‌آوری خطاپذیرند.
  • غلبهٔ یک وجه. وقتی متن و تصویر تناقض دارند، مدل معمولاً به متن اعتماد می‌کند — چون بخش عمدهٔ آموزشش متنی بوده.
  • هزینهٔ پردازش. تصویر و به‌ویژه ویدیو، حجم محاسباتی بسیار بیشتری از متن مصرف می‌کنند.
  • سطح حملهٔ گسترده‌تر. دستور مخرب می‌تواند درون یک تصویر پنهان شود — متنی ریز در گوشهٔ عکس که مدل آن را می‌خواند و اجرا می‌کند.
در کاربردهای حساس

هرگز خروجی مدل چندوجهی را به‌تنهایی مبنای تصمیم پزشکی، ایمنی یا حقوقی قرار ندهید. این مدل‌ها ابزار کمکی برای متخصص هستند، نه جایگزین او.

پرسش‌های متداول دربارهٔ هوش مصنوعی چندوجهی

آیا هر مدلی که عکس قبول می‌کند چندوجهی است؟

نه لزوماً. اگر سیستم پشت پرده عکس را با یک ابزار جداگانه به متن تبدیل کند و بعد متن را به مدل زبانی بدهد، این زنجیره‌سازی است نه چندوجهی بودن. مدل چندوجهی واقعی، تصویر را به‌صورت خام در همان فضای پردازشی متن دریافت می‌کند.

چه تفاوتی با هوش مصنوعی مولد دارد؟

این دو مفهوم روی دو محور متفاوت‌اند و می‌توانند هم‌پوشانی داشته باشند. «مولد» به این اشاره دارد که مدل محتوای تازه می‌سازد. «چندوجهی» به این اشاره دارد که با چند نوع داده کار می‌کند. مدلی که از متن تصویر می‌سازد، هم مولد است و هم چندوجهی؛ مدلی که فقط تصویر را دسته‌بندی می‌کند، هیچ‌کدام نیست.

آیا مدل چندوجهی دقیق‌تر از مدل تک‌وجهی است؟

در کارهایی که واقعاً به ترکیب اطلاعات نیاز دارند، بله — چون اطلاعات بیشتری در اختیار دارد. اما در کاری که کاملاً در یک وجه تعریف می‌شود، یک مدل تخصصی تک‌وجهی معمولاً دقیق‌تر، سریع‌تر و ارزان‌تر است. چندوجهی بودن به‌خودی‌خود مزیت نیست.