Открытый бенчмарк livenerf проверяет качество моделей ИИ после релиза
Разработчик ninjahawk запустил проект livenerf — открытый бенчмарк для проверки деградации качества моделей ИИ после их релиза. Инструмент создан для объективной оценки жалоб пользователей на снижение эффективности систем, таких как Claude Opus 5.5.
Методология тестирования базируется на строгом отборе задач и контроле параметров среды.
Из начального набора в 2336 вопросов (GPQA Diamond, MMLU-Pro, олимпиадная математика) были отобраны 78 задач, где модель отвечает верно лишь иногда. Панель тестов прогоняется ежедневно в течение 30 дней, первые 10 из которых служат эталоном. Промпты заморожены, версия Claude Code зафиксирована, а ответы сверяются методом точного совпадения без участия ИИ-судьи.
Для исключения влияния изменений платформы параллельно проводится контроль модели Opus 5. Если обе модели демонстрируют просадку, это указывает на проблему инфраструктуры, а не самой версии Opus 5.5.
Ключевым индикатором потенциального ухудшения считается количество выходных токенов. Снижение этого показателя может сигнализировать о том, что модель начинает «думать меньше», что часто предшествует падению общей точности ответов.
Техническая реализация проекта использует Inspect — открытый фреймворк британского института безопасности ИИ. Тестирование доступно через обычную подписку Max без необходимости использования API-ключа. Первые результаты ожидаются около 24 октября, после сбора данных за шесть дней мониторинга.









