С увеличением зависимости агентов LLM от навыков, извлекаемых в реальном времени, выбор подходящих навыков из обширных баз данных стал серьезной проблемой. Это исследование представляет систему маршрутизации навыков, охватывающую более 34 000 навыков, и анализирует эффективность извлечения навыков с использованием ограниченного реального надзора и синтетических данных. Результаты показывают, что хотя тонкая настройка с использованием синтетических данных улучшает точность извлечения в пределах обучающей выборки, она также приводит к катастрофическому забыванию навыков за пределами этой выборки. Для решения этой проблемы были оценены различные стратегии, вдохновленные непрерывным обучением, включая регуляризацию якоря встраивания, Обучение без Забывания (LwF), Эластичную Консолидацию Весов (EWC) и L2-инициализацию. Оценка показала, что эти методы не только сохраняли производительность в извлечении навыков вне распределения, но и увеличивали точность извлечения синтетических навыков в пределах распределения почти на 14% для конкретной модели извлекателя. Это исследование предлагает ценные идеи и практическую основу для эффективной тонкой настройки моделей с ограниченным надзором.
Опасности Синтетических Данных: Катастрофическое Забывание в Извлечении Навыков LLM
В этом исследовании рассматриваются проблемы извлечения навыков в агентах LLM и негативные последствия синтетических данных для производительности.
