Claude Opus 5, единый mini‑SWE‑agent
Не «кто умнее», а какая модель лучше для вашей задачи
Интерактивное сравнение GPT‑5.6 Sol, Claude Opus 5, Claude Fable 5, Kimi K3 и Grok 4.5. Отдельно показаны результаты с единым harness и смешанные vendor-замеры.
Баллы оценивают связку «модель + агент + effort + инструменты», а не модель в вакууме.
GPT‑5.6 Sol: на 1 п.п. ниже, но дешевле
Grok 4.5 за попытку DeepSWE
Kimi K3 при средней цене $4.65
Профили и API-цены
Цены указаны за 1 млн токенов и не учитывают кэширование, batch и длинный контекст.
DeepSWE v1.1 — единый harness
Все модели запущены на mini‑SWE‑agent. Здесь сравнение наиболее близко к «лоб в лоб».
Полные метрики DeepSWE
Обновление независимого leaderboard: 25 июля 2026
| Модель | Score | Цена / попытку | Output tokens | Шаги | Расчёт $/успех |
|---|
Матрица coding-бенчмарков
Пустая ячейка означает, что сопоставимый публичный результат не найден. Vendor-результаты не усредняются.
Опубликованные результаты
—
Как читать результаты
Не существует честного единого рейтинга: разные типы инженерной работы требуют разных сильных сторон.
Максимум качества
Claude Opus 5 лидирует в независимом DeepSWE и близок к Fable на repo-level задачах при вдвое меньшей API-цене.
Баланс продакшена
GPT‑5.6 Sol отстаёт от лидера DeepSWE всего на один пункт, но использует примерно вдвое меньше output-токенов.
Open-weight и автономность
Kimi K3 особенно интересен для самостоятельного хостинга и длинных agentic-сессий; на SWE Marathon он показывает сильный результат.
Цена и throughput
Grok 4.5 заметно уступает по DeepSWE score, зато завершает попытку с минимальными затратами и небольшим объёмом вывода.
Методология
Сайт сохраняет исходные опубликованные баллы и не строит непрозрачный «общий интеллект». У каждой строки есть уровень сопоставимости и источник.
Общий benchmark, harness и набор задач.
Одинаковое название benchmark, но возможны разные effort, agent scaffold или инфраструктура.
Vendor-таблицы, изменённые наборы или заметно разные условия.
Не делайте вывод по 0.5–1 п.п.
На небольших выборках доверительные интервалы часто перекрываются, а повторный запуск может изменить порядок соседних моделей.
Основные источники
Ссылки ведут на страницы разработчиков и независимые leaderboard.