
«`html
Многоступенчатые запросы всегда были сложными для агентов LLM, так как требуют нескольких шагов рассуждений и информации из разных источников. Они важны для анализа понимания модели, ее способности к рассуждениям и вызову функций.
Существующие работы в этой области не предлагают надежных методов оценки. Методы, предложенные до сих пор, основывались на конструкциях данных, управляемых инструментами, что создает проблемы с оценкой многоступенчатого рассуждения и вводит предвзятость моделей.
Исследователи из Университета Фудань и ByteDance представили ToolHop — набор данных, специально разработанный для оценки многоступенчатых инструментов. Он включает 995 тщательно разработанных пользовательских запросов и 3,912 связанных инструментов.
Предложенная схема состоит из трех ключевых этапов:
Команда провела оценку ToolHop на четырнадцати LLM из пяти семейств. Использование инструментов увеличило производительность моделей в среднем на 12%, а для моделей GPT — на 23%. Однако модели все еще ошибались около 10% времени.
Данная работа представляет собой обширный набор данных для решения многоступенчатых запросов с использованием специально разработанных запросов и инструментов. Хотя LLM значительно улучшили свои способности к решению сложных многоступенчатых запросов, есть еще много возможностей для улучшения.
Если вы хотите, чтобы ваша компания развивалась с помощью искусственного интеллекта (ИИ), следуйте этим шагам:
Если вам нужны советы по внедрению ИИ, пишите нам. Узнайте, как ИИ может изменить процесс продаж в вашей компании с решением от saile.ru — будущее уже здесь!
«`
Оставьте заявку — мы свяжемся с вами и расскажем, как начать работу