
«`html
Открытые MLLMs имеют большой потенциал для выполнения различных задач, сочетая визуальные кодировщики с языковыми моделями. Однако их способности к рассуждению можно улучшить.
Существующие наборы данных для обучения часто заимствованы из академических источников и сосредоточены на простых задачах. Это ограничивает возможности для более сложного рассуждения.
Метод CoT (Chain of Thought) может помочь, но требует создания наборов данных с детальными обоснованиями и пошаговыми рассуждениями. Создание таких наборов данных в больших масштабах сложно из-за высоких затрат на аннотацию.
Недавние усилия направлены на создание мультимодальных наборов данных с использованием только открытых ресурсов. Это включает:
Исследователи из нескольких университетов разработали эффективный метод создания мультимодального набора данных с 12 миллионами пар, сосредоточенного на задачах, требующих рассуждений, таких как решение математических задач и OCR.
Процесс включает три этапа:
Качество набора данных MAmmoTH-VL-Instruct было оценено с использованием модели InternVL2-Llama3-76B. Результаты показали, что переработанные данные превосходят оригинальные по глубине и соответствию.
Исследование представляет эффективный подход к улучшению MLLMs, создавая разнообразные и качественные обучающие наборы данных. Набор данных MAmmoTH-VL-Instruct, состоящий из 12 миллионов мультимодальных записей, обеспечивает высокую производительность в различных задачах.
Если вы хотите, чтобы ваша компания развивалась с помощью искусственного интеллекта (ИИ), следуйте этим рекомендациям:
Если вам нужны советы по внедрению ИИ, пишите нам.
Узнайте, как ИИ может изменить процесс продаж в вашей компании с помощью AI Sales Bot. Это AI ассистент для продаж, который помогает отвечать на вопросы клиентов и генерировать контент для отдела продаж.
«`
Оставьте заявку — мы свяжемся с вами и расскажем, как начать работу