На недавнем вебинаре аналитик задал вопрос о иерархических индексах для нормативных документов, особенно о структуре 'документ → статья → пункт.' Эта модель позволяет спускаться от корня, как человек листает оглавление. Однако разговор быстро перешел к затратам на индексацию, которая требует обхода всего корпуса документов. Я сравнил этот метод индексации с B-деревом. После некоторых расчетов сравнение оказалось обоснованным. В B-дереве узлы оптимизируются под дисковые блоки, чтобы минимизировать движение головки. В этом контексте блок представляет собой эффективное окно в меньшую модель, а движение головки — это доступ к этой модели. Например, шесть актов на примерно 200 страниц имеют глубину два, а 2 миллиона токенов увеличивают глубину до трех. Навигатор может читать от 8 000 до 12 000 токенов вместо всего корпуса. Иерархическая структура уже присутствует в юридических текстах, включая главы, статьи, части и пункты, построенная с помощью регулярных выражений по нумерации без необходимости в модели. Задача навигатора — выбрать одну из пятидесяти веток по краткому описанию, что ближе к классификации, чем к рассуждению. В зале был задан вопрос, справится ли модель с 1,5–3 миллиарда параметров с этой задачей. Интрига продолжается, пока мы исследуем методы получения точных ответов из юридически значимой документации.
Как эффективно искать с агентами по нормативке?
Изучаем методы получения точных ответов из юридической документации.
