Реклама

RAG по 11 000 файлов: почему семантический поиск не находит по артикулу

#Разбираю #Читать #Хабр

11 000 файлов техдокументации, больше 100 менеджеров по продажам и бот, который уверенно называл числа из паспорта соседнего станка. Разбираю, почему плотные векторы промахиваются по артикулам, и что в итоге сработало. Читать далее

Привет! Меня зовут Дмитрий, я работаю в компании Cortex IT и автоматизирую бизнес-процессы наших клиентов. Среди прочего мы строим RAG-ассистентов по внутренней документации.

На одном из проектов было много нестандартной технической документации на оборудование, и с настройками по умолчанию поиск отдавал не те чанки. Пришлось разбираться, почему так происходит.

У дистрибьютора промышленного оборудования есть база: паспорта станков, мануалы, спецификации, обучающие видео. Одиннадцать тысяч файлов. В отделе продаж больше сотни менеджеров, и каждый из них регулярно ищет в этой базе конкретные факты: максимальные габариты заготовки, расшифровку ошибки ЧПУ-стойки, что входит в базовую комплектацию и пр. Ищут вручную, по папкам, или спрашивают коллегу, который «вроде помнит».

Задача выглядела как хрестоматийный RAG: проиндексировать документы, поднять бота в мессенджере, отвечать по найденным фрагментам. Дальше о том, где он ломался и что мы с этим сделали.