Так как же всё-таки искать с агентами по нормативке?

#Аналитик #B-деревом #Потом #B-дереве #Здесь
Так как же всё-таки искать с агентами по нормативке?

Аналитик на вебинаре поинтересовался иерархическими индексами для нормативки: дерево «документ → статья → пункт», модель спускается от корня и выбирает ветку, как человек листает оглавление. И сразу про затраты: индексация — это проход по всему корпусу. Я сравнил такой индекс с B-деревом. Потом сел считать, и сравнение выдержало. В B-дереве на диске узел подгоняют под блок, чтобы реже перемещать головку. Здесь блок — эффективное окно маленькой модели, а движение головки — обращение к ней. Прикинем. Шесть актов на ~200 страниц — глубина 2. 2M токенов — глубина 3. Навигатор читает 8–12 тысяч токенов вместо всего корпуса. А само дерево в законах уже есть: главы, статьи, части, пункты. Строится регекспами по нумерации, без модели. Затраты один раз и только за краткое описание внутренних узлов. Навигатору остаётся выбрать одну из пятидесяти веток по короткому описанию. Это ближе к классификации, чем к рассуждению. В зале спросили, справится ли с этим модель на 1,5–3 млрд параметров. Интрига

1 сентября я вёл вебинар о том, как научить агента читать документацию к внутреннему фреймворку. Демо было про код: нишевый Java-фреймворк, библиотека без исходников, AGENTS.md рядом с проектом.

А первый вопрос из зала был не про код. Системный аналитик собирает систему, которая отвечает по корпусу приказов ИБ, ГОСТов и спецификаций. Ему нужен ответ со ссылкой на пункт. Структуру документа трогать нельзя: документ юридически значим.

В чате возразили. К концу эфира развилась дискуссия.

В коде у агента есть арбитр - это компилятор. Выдумал метод — сборка красная. Ловится не всё: на том же вебинаре у участника сборка прошла, а экран упал в рантайме. Но арбитр есть.