Срез данных на 28 июля 2026

Не «кто умнее», а какая модель лучше для вашей задачи

Интерактивное сравнение GPT‑5.6 Sol, Claude Opus 5, Claude Fable 5, Kimi K3 и Grok 4.5. Отдельно показаны результаты с единым harness и смешанные vendor-замеры.

Баллы оценивают связку «модель + агент + effort + инструменты», а не модель в вакууме.

Лидер DeepSWE 74%

Claude Opus 5, единый mini‑SWE‑agent

Баланс 73% / $8.39

GPT‑5.6 Sol: на 1 п.п. ниже, но дешевле

Минимальная цена $2.42

Grok 4.5 за попытку DeepSWE

Open-weight 69%

Kimi K3 при средней цене $4.65

Пять моделей

Профили и API-цены

Цены указаны за 1 млн токенов и не учитывают кэширование, batch и длинный контекст.

Высокая сопоставимость

DeepSWE v1.1 — единый harness

Все модели запущены на mini‑SWE‑agent. Здесь сравнение наиболее близко к «лоб в лоб».

Выше — лучше · 113 задач
Один benchmark, общий агент $/успех — расчётная стоимость: цена попытки ÷ вероятность решения

Полные метрики DeepSWE

Обновление независимого leaderboard: 25 июля 2026

Открыть источник ↗
Модель Score Цена / попытку Output tokens Шаги Расчёт $/успех
Широкий публичный срез

Матрица coding-бенчмарков

Пустая ячейка означает, что сопоставимый публичный результат не найден. Vendor-результаты не усредняются.

Опубликованные результаты

Практический выбор

Как читать результаты

Не существует честного единого рейтинга: разные типы инженерной работы требуют разных сильных сторон.

01

Максимум качества

Claude Opus 5 лидирует в независимом DeepSWE и близок к Fable на repo-level задачах при вдвое меньшей API-цене.

02

Баланс продакшена

GPT‑5.6 Sol отстаёт от лидера DeepSWE всего на один пункт, но использует примерно вдвое меньше output-токенов.

03

Open-weight и автономность

Kimi K3 особенно интересен для самостоятельного хостинга и длинных agentic-сессий; на SWE Marathon он показывает сильный результат.

04

Цена и throughput

Grok 4.5 заметно уступает по DeepSWE score, зато завершает попытку с минимальными затратами и небольшим объёмом вывода.

Без маркетинговой магии

Методология

Сайт сохраняет исходные опубликованные баллы и не строит непрозрачный «общий интеллект». У каждой строки есть уровень сопоставимости и источник.

Высокая

Общий benchmark, harness и набор задач.

Средняя

Одинаковое название benchmark, но возможны разные effort, agent scaffold или инфраструктура.

Ограниченная

Vendor-таблицы, изменённые наборы или заметно разные условия.

Не делайте вывод по 0.5–1 п.п.

На небольших выборках доверительные интервалы часто перекрываются, а повторный запуск может изменить порядок соседних моделей.

Проверяемость

Основные источники

Ссылки ведут на страницы разработчиков и независимые leaderboard.