#Terminal-Bench

3 статьи
Дал девяти популярным скиллам для Claude Code плацебо: два лучше пустышки, один хуже Хабр
Хабр

Дал девяти популярным скиллам для Claude Code плацебо: два лучше пустышки, один хуже

Я сравнил девять самых популярных скиллов для Claude Code с пустышкой: нейтральным текстом той же длины, без единого совета, как работать. Агент 450 раз решал задачи из SWE-bench и Terminal-Bench со с...

Хабр
Одна модель, разные результаты: как инфраструктура меняет бенчмарки ИИ-агентов Хабр
Хабр

Одна модель, разные результаты: как инфраструктура меняет бенчмарки ИИ-агентов

В этом году Anthropic опубликовала исследование инфраструктурного шума в бенчмарках для ИИ-агентов, которые пишут и запускают код. На Terminal-Bench 2.0 разница между самой строгой и неограниченной ко...

Хабр
Бенчмарк Маракуйя ИИ на Terminal-Bench 4 и OSWorld 2 Хабр
Хабр

Бенчмарк Маракуйя ИИ на Terminal-Bench 4 и OSWorld 2

Всем привет! В прошлой статье я гонял Алису и Гигачат как чаты: Arena-Hard, WildBench, MultiChallenge, τ³, ПРАКТ-120. Там модель должнв была отвечать текстом в браузере - как будто она общалас с польз...

Хабр