Непрерывное семантическое погребение для низкоскоростного лмса, обслуживающего
arXiv:2604.20021v2 Annuales Type: заменить перекрестное резюме: поскольку крупные языковые модели (LMS) становятся все более популярными, кандалы ответов, с тем чтобы они могли быть повторно использованы пользователями, имеющими семантически схожие запросы, стали жизненно важной стратегией сокращения затрат на выводы и запоздалость. Существующие системы секвестрирования предлагают решить, какие ответы на запрос в кэше будут зависеть от конечной известной совокупности дискретных запросов и изучая их сервисные расходы и вероятность прибытия. Однако по мере расширения круга пользователей и запросов МЛМ такое предположение становится все более несостоятельным: реальные запросы на МУЗ находятся в бесконечном, непрерывно используемом пространстве. В этом документе мы закладываем первую жесткую теоретическую основу для семантического ответа LLM в непрерывном пространстве запроса при неопределенности. Чтобы преодолеть разрыв между дискретной оптимизацией и непрерывным представительством, мы введем динамическую декрецию в размере $epsilon-net в сочетании с регрессией Kernel Ridge. Этот дизайн позволяет th