TL;DR. 4 августа Mistral выложил Shieldstral — 3B-классификатор безопасности с открытыми весами под Apache 2.0. Главная идея: политика модерации задаётся не весами, а вопросом в промпте, а вердикт читается из логитов двух токенов. Модель в 7 раз меньше конкурентов и при этом не хуже. А заодно это отличный повод поговорить о том, почему европейские лабы уверенно делают OCR и TTS и так же уверенно не делают фронтир-LLM.
Проблема, которую все обходят стороной
Если вы когда-нибудь ставили guardrail перед своим LLM-приложением, то знаете эту боль. Берёте Llama Guard (или любой другой guard-модель), а он приходит с зашитой в веса таксономией вреда: насилие, оружие, селфхарм, ещё десяток категорий, спасибо, до свидания.
Дальше выясняется, что ваша конкретная таксономия не совпадает с их конкретной таксономией. Потому что «небезопасный контент» — это не свойство текста, а функция от продукта, аудитории и момента. Обсуждение эксплойта — норма для пентест-платформы и катастрофа для приложения с подростковой аудиторией. Разговор про дозировки — норма для медицинского ассистента и красный флаг для чат-бота поддержки.