چندوجهی Multimodal

مدلی که هم‌زمان متن، تصویر، صدا و ویدیو را می‌فهمد یا می‌سازد؛ مثلاً عکس می‌فرستید و دربارهٔ آن سؤال می‌پرسید.

مدل‌های نسل جدید فقط متن نمی‌خوانند: عکس را توصیف می‌کنند، از روی اسکرین‌شات کد می‌نویسند، صدا را می‌فهمند. Gemini و ChatGPT در این زمینه پیشرو هستند.

حالت صوتی زنده و تحلیل ویدیو معمولاً به پلن پولی محدود است.

واژه‌های مرتبط