Привет! Меня зовут Дмитрий, я работаю в компании Cortex IT и автоматизирую бизнес-процессы наших клиентов. Среди прочего мы строим RAG-ассистентов по внутренней документации.
На одном из проектов было много нестандартной технической документации на оборудование, и с настройками по умолчанию поиск отдавал не те чанки. Пришлось разбираться, почему так происходит.
У дистрибьютора промышленного оборудования есть база: паспорта станков, мануалы, спецификации, обучающие видео. Одиннадцать тысяч файлов. В отделе продаж больше сотни менеджеров, и каждый из них регулярно ищет в этой базе конкретные факты: максимальные габариты заготовки, расшифровку ошибки ЧПУ-стойки, что входит в базовую комплектацию и пр. Ищут вручную, по папкам, или спрашивают коллегу, который «вроде помнит».
Задача выглядела как хрестоматийный RAG: проиндексировать документы, поднять бота в мессенджере, отвечать по найденным фрагментам. Дальше о том, где он ломался и что мы с этим сделали.