
«`html
Лексико-ориентированные эмбеддинги являются хорошей альтернативой плотным эмбеддингам, но сталкиваются с рядом проблем, которые ограничивают их использование. Основная проблема — это избыточность токенизации, когда токены разбиваются на подслова, что приводит к неэффективности и несоответствиям в эмбеддингах. Также существует ограничение одностороннего внимания в причинных языковых моделях, что не позволяет токенам полностью использовать окружающий контекст.
Исследователи из Университета Амстердама, Университета Технологий Сиднея и Tencent IEG предложили LENS (Лексико-ориентированные Эмбеддинги), новую структуру, которая решает проблемы текущих методов. LENS использует KMeans для кластеризации семантически аналогичных токенов, что позволяет минимизировать избыточность и размерность эмбеддингов.
Использование двустороннего внимания позволяет токенам использовать контекст с обеих сторон, что улучшает понимание. LENS также сочетает лексико-ориентированные и плотные эмбеддинги, что делает его эффективным для различных задач, таких как кластеризация, классификация и извлечение информации.
LENS демонстрирует выдающиеся результаты на различных бенчмарках, таких как Massive Text Embedding Benchmark (MTEB). Модель LENS-8000 показывает наилучшие результаты среди публично обученных моделей, превосходя плотные эмбеддинги в шести из семи классификаций задач.
Если вы хотите, чтобы ваша компания развивалась с помощью искусственного интеллекта (ИИ), следуйте этим шагам:
Если вам нужны советы по внедрению ИИ, пишите нам в Телеграм. Узнайте, как ИИ может изменить процесс продаж в вашей компании с решением от saile.ru. Будущее уже здесь!
«`
Оставьте заявку — мы свяжемся с вами и расскажем, как начать работу