Мультимодальная модель обрабатывает не только текст, но и изображения, аудио или видео в рамках одной системы — без отдельных специализированных моделей под каждый тип данных.
Практические сценарии — описание содержимого фото по запросу, расшифровка и анализ видео, ответы на вопросы по диаграммам и графикам без предварительного распознавания текста отдельным инструментом.
Ограничение — качество падает на редких комбинациях данных, которых было мало в обучающей выборке, например специфичные технические чертежи или рукописный текст на непривычном языке.
RSYA AD
Комментарии