跳转至

Глава 6 · Оценка агентов

Превращает качество агента в сравнимые сигналы. Охватывает среды оценки, дизайн наборов данных, системы метрик, статистическую значимость, наблюдаемость, выбор на основе оценки, а также промышленные внутренние среды оценки и симуляции.

К оглавлению · 📖 Читать главу

Сопутствующие проекты

Эксп. Проект Тип Описание
6-1 tau2-bench/ 📖 Фокусируется на оценке способности агента использовать инструменты для сложных рассуждений, включая сценарии вычислений, поиска и обработки данных.
6-2 tau2-bench/ 📖 Ручное выполнение градуированных задач τ²-bench с записью траекторий.
6-3 user-memory-evaluation Применяет четырёхуровневую рубрику к 180 структурированным оценкам с доказательствами и запретом галлюцинаций.
6-4 user-memory-system-evaluation Запускает 60 случаев на трёх системах с полным учётом стоимости.
6-10 user-memory-system-evaluation 🚧 Полная матрица компонентов, моделей и оценщиков 4×3×2×60 остаётся незавершённой.
6-12 openvla-robotwin2-eval Официальный запуск на одной GPU завершил по 256 эпизодов в каждой группе: chunk 1 — 0/256, chunk 25 — 26/256; сохранены хэши 512 rollout.
6-2 terminal-bench/ 📖 Terminal-Bench — бенчмарк для проверки качества ИИ-агентов в реальных терминальных средах. От компиляции кода до обучения моделей и настройки серверов — оценивает, как агенты справляются с реальными сквозными задачами. Включает набор из ~100 задач и фреймворк исполнения, поддерживая разные реализации агентов.
6-2 SWE-bench/ 📖 SWE-bench — бенчмарк для оценки способности больших языковых моделей решать реальные GitHub-issue. По кодовой базе и описанию проблемы модель должна сгенерировать патч, устраняющий проблему. Включает несколько версий: SWE-bench, SWE-bench Lite, SWE-bench Verified и SWE-bench Multimodal.
6-2 GAIA/ 📖 GAIA нацелен на оценку LLM нового поколения (с дополнением инструментами, эффективным промптингом, доступом к поиску и т. д.). Содержит 450+ нетривиальных вопросов, требующих разной степени использования инструментов и автономности, с однозначными ответами. Разделён на 3 уровня сложности.
6-2 OSWorld/ 📖 Оценивает способность агентов выполнять сложные задачи в полноценной среде операционной системы, включая управление файлами, работу с приложениями и настройку системы.
6-2, 6-11 android_world/ 📖 Оценивает качество агента в мобильной среде Android: навигация по приложениям, взаимодействие с UI и выполнение задач (внешний репозиторий бенчмарка).
6-5 tts-quality-eval Синтезирует один и тот же набор сложных текстов разными конфигурациями TTS (модель/голос/скорость), затем через мультимодальный LLM-as-a-Judge оценивает каждое измерение (чёткость, естественность и т. д.) по рубрике, агрегируя результаты в воспроизводимую сравнительную таблицу конфигураций.
6-6 elo-leaderboard Реализует таблицу лидеров агентов на основе рейтинговой системы ELO, оценивая относительные способности разных агентов через попарные сравнения.
6-7 model-action-threshold Сравнивает GPT-5.6-sol и Claude Sonnet 5 в момент перехода от исследования к первой правке при одном и том же нейтральном Coding Harness; все 18/18 ячеек завершены без ошибок API, а манифест связывает траектории и сводки проверяемыми хешами.
6-8 agent-cost-analysis Делает сквозную декомпозицию стоимости для типичной многораундовой задачи агента (возврат в поддержке): с помощью собственной лёгкой системы трассировки записывает входные/выходные/кэш-токены, задержку и стоимость каждого вызова LLM, агрегирует, чтобы найти «самый дорогой шаг», а затем A/B-тестами количественно оценивает реальную экономию от дружественного к KV-кэшу дизайна и сжатия контекста.
6-9 model-benchmark Проводит горизонтальный бенчмарк нескольких OpenAI-совместимых провайдеров LLM API. Через потоковый интерфейс точно измеряет время до первого токена (TTFT), рассчитывает перцентили сквозной задержки (p50/p95), пропускную способность и долю успеха при конкурентности. Одной командой строит многомерную сравнительную таблицу, показывая, что выбор модели — это многогранный компромисс, а не просто взгляд на таблицу лидеров.
6-11 android-world 📖 Внутрирепозиторные отчёт и разбор ошибок T3A на AndroidWorld (старт эксперимента 6-11; не исходники бенчмарка).
public-health-reporting-eval На синтетических агрегированных данных в стиле DHIS2 объективно оценивает вызовы инструментов, точность вычислений, цитирование доказательств и неподтверждённые утверждения у агента отчётности в общественном здравоохранении.

Внешние бенчмарки в обратных кавычках нужно клонировать отдельно. android-world/ (через дефис) — аналитические заметки T3A в этом репозитории (см. README), это не тот же путь, что внешний android_world/.

Типы проектов

Значок Тип Значение
Автономный Полный код в этом репозитории, запускается после настройки API-ключа
📖 Гайд по воспроизведению Подробный документ, зависящий от внешних репозиториев через git clone
🚧 Проектный документ Только архитектура/план реализации, рабочий код ещё в разработке