En un reciente seminario web, un analista planteó una pregunta sobre los índices jerárquicos para documentos regulatorios, específicamente la estructura 'documento → artículo → sección.' Este modelo permite descender desde la raíz, similar a cómo se navega en una tabla de contenido. Sin embargo, la discusión rápidamente se centró en los costos asociados con la indexación, que implica recorrer todo el corpus documental. Comparé este método de indexación con una estructura de árbol B. Después de algunos cálculos, la comparación resultó válida. En un árbol B, los nodos se optimizan para bloques de disco para minimizar el movimiento de la cabeza. En este contexto, un bloque representa una ventana eficiente hacia un modelo más pequeño, mientras que el movimiento de la cabeza se refiere al acceso a ese modelo. Por ejemplo, con seis actos que abarcan aproximadamente 200 páginas, la profundidad es de dos, y con 2 millones de tokens, la profundidad aumenta a tres. El navegador puede leer entre 8,000 y 12,000 tokens en lugar de todo el corpus. La estructura jerárquica ya está presente en los textos legales, incluidos capítulos, artículos, partes y secciones, construida utilizando expresiones regulares basadas en la numeración sin necesidad de un modelo. La tarea del navegador es seleccionar una de las cincuenta ramas según una breve descripción, inclinándose más hacia la clasificación que hacia el razonamiento. Se planteó una pregunta en la sala sobre si un modelo con 1.5 a 3 mil millones de parámetros podría manejar esta tarea. La intriga continúa mientras exploramos métodos para obtener respuestas precisas de documentación legalmente significativa.
¿Cómo buscar eficazmente con agentes regulatorios?
Explorando métodos para obtener respuestas precisas de la documentación legal.
