Компьютерные науки > Компютерное видение и распознавание шаблона [представлено 4 сентября 2026 года] Название: Time-Assistive Watch View PDF HTML (экспериментальное) Резюме: могут ли интерактивные агенты, занимающиеся зрением и языком, научиться не только что говорить, но также /textbf {\texsit}, чтобы сказать это? Нынешние языковые модели редко планируют, следует ли и когда реализовать ответ в режиме реального времени для пользователя. Вместе с тем для обеспечения точной и своевременной поддержки процесса принятия решений людьми, например в том, что касается ориентации лиц со слабым зрением через городскую среду, требуется тщательное реагирование в режиме реального времени - плохосвоевременная реакция может отвлечь пользователей или добавить ненужную когнитивную нагрузку. В качестве задачи машинной разведки для мультимодальных крупных языковых моделей (MLM) мы внедряем крупномасштабный смешанный контрольный показатель для эгоцентрической, ассистирующей навигационной задачи в сложных внешних средах. Используя этот контрольный показатель, мы обнаруживаем фундаментальное ограничение использования ММЛМ для получения безопасных и чувствительных к времени навигационных инструкций даже при тщательном уточнении моделей на основе значительного объема данных. Затем мы показываем, что простая и вместе с тем эффективная модификация модели, включая прямой надзор для прогнозирования основной причины каждой инструкции, приносит значительные результаты в работе на всех открытых, закрытых и…
Ассистентное плавание с учетом времени
arXiv: 26009,05596v1 Annuales Type: New Humber Abstract: Может ли интерактивные агенты-зрители научиться не только тому, что сказать, но и тому, чтобы говорить? Нынешние языковые модели редко планируют, следует ли и когда реализовать ответ в режиме реального времени для пользователя. Вместе с тем для обеспечения точной и своевременной поддержки процесса принятия решений людьми, например в том, что касается ориентации лиц со слабым зрением через городскую среду, требуется тщательное реагирование в режиме реального времени - плохосвоевременная реакция может отвлечь пользователей или добавить ненужную когнитивную нагрузку. В качестве задачи машинной разведки для мультимодальных крупных языковых моделей (MLM) мы внедряем крупномасштабный смешанный контрольный показатель для эгоцентрической, ассистирующей навигационной задачи в сложных внешних средах. Используя этот контрольный показатель, мы обнаруживаем фундаментальное ограничение использования ММЛМ для получения безопасных и чувствительных к времени навигационных инструкций даже при тщательном уточнении моделей на основе значительного объема данных. Затем мы покажем, что простая, но эффе