Исследование предвзятости в больших языковых моделях для манипуляции поиском ИИ

Данное исследование изучает предвзятости, присутствующие в больших языковых моделях (LLM), и их влияние на системы поиска на основе ИИ.

5 min readТехнологии

Большие языковые модели (LLM) стали неотъемлемой частью различных бизнес-приложений, особенно в улучшении функций веб-поиска. Эти модели используются в системах обзора LLM, которые анализируют результаты поиска, чтобы определить наиболее актуальные источники и сформулировать ответы на запросы пользователей. Исследования показывают, что LLM имеют различные предвзятости, которые могут влиять как на выбор источников, так и на генерацию ответов в этих системах. Эта статья в основном сосредоточена на этапе выбора, исследуя, как предвзятости могут быть использованы для манипуляции результатами в системах обзора LLM. Для этого мы разработали компактную языковую модель, обученную с помощью обучения с подкреплением, чтобы изменять фрагменты поиска, тем самым увеличивая их привлекательность для LLM-обзоров. Наша экспериментальная схема ограничивает модель работой только с фрагментами и ограничивает стратегии манипуляции вознаграждением, отражая реальные ограничения, встречающиеся в веб-поиске. Результаты показывают, что в системах LLM-обзора существуют предвзятости, и что обучение с подкреплением часто может улучшать содержание фрагментов для манипуляции результатами. Кроме того, мы обнаружили, что выборы более всего зависят от сравнительных преимуществ среди источников, чем от абсолютных достоинств. Мы также оцениваем аспекты безопасности манипуляции LLM-обзорами, подчеркивая, что атаки отравления контекста могут привести к неточным или вредным результатам.

Технологии