Сравнения

Лучшая нейросеть для написания кода: сравнение моделей

30.08.2026

Лучшая нейросеть для написания кода выбирается по зачётам, где результат проверяется тестами: код либо проходит проверку, либо нет. Ниже собраны свежие независимые замеры — Terminal-Bench 4.0, сводный индекс Artificial Analysis и арена WebDev, — и у каждого числа стоит имя источника и дата снимка. Дальше идёт разбор по отдельным работам: правка чужого проекта, задачи в терминале, сборка интерфейса, объяснение незнакомого файла, большой репозиторий целиком — и цены на те же модели за рубли.

Попробуйте Claude Opus 5, Claude Fable 5 и GPT-5.6 — чат с нейросетью онлайн и без регистрации, ниже на странице.

Коротко: какая нейросеть лучше всего пишет код

Верх свежего зачёта по коду занимает Claude Opus 5. В Terminal-Bench 4.0 связка Claude Code с Opus 5 решает 51,82 % задач при доверительном интервале ±3,39 — знак ± показывает разброс, в котором результат может гулять в обе стороны, и чем он меньше, тем точнее известен результат. Это первое место таблицы (Terminal-Bench 4.0, проект Стэнфорда и Laude Institute, таблица обновлена 29 августа 2026 года). За ней идут Claude Fable 5 с 44,55 % ±3,85, GLM-5.3 с 41,82 % ±3,23 и GPT-5.6 Sol в обвязке Codex с 37,27 % ±3,78.

Сводный зачёт по коду у Artificial Analysis выстраивает те же модели иначе. По колонке Coding Index выше всех в верхних тридцати строках снимка стоит GPT-5.6 Sol в режиме xhigh — 78,3 балла, следом Claude Opus 5 в режиме max с 78,0, GPT-5.6 Sol в режиме max с 77,4 и Claude Fable 5 с 76,5 (Artificial Analysis, Intelligence Index v4.1.1, дата забора 30 августа 2026 года).

Слепые голоса людей на задании «собери работающий сайт или приложение» дают третий порядок. Человеку показывают два результата по одному запросу, названия моделей скрыты, и он выбирает лучший; из тысяч таких голосов складывается оценка, которая в таблице подписана словом Elo, и чем она выше, тем чаще модель выбирают. В WebDev Arena первое место у Claude Opus 5 в режиме max — 1691 очко при 8 116 голосах, второе у Kimi K3 max с 1674, третье у Qwen3.8 Max с 1669 (Arena, WebDev Arena, снимок 21 августа 2026 года).

Три зачёта дают три разных верхних строки, и это не противоречие: они меряют разную работу. Terminal-Bench проверяет доведение задачи до конца в терминале, Coding Index собран из коротких заданий с автоматической проверкой, WebDev Arena считает человеческие предпочтения на глаз. Дальше каждый зачёт разобран отдельно, с методикой и полными таблицами.

Как читать зачёты: число описывает связку «агент и модель»

Terminal-Bench ставит модели задачу и даёт доступ к терминалу, а результат проверяет набор тестов: задача засчитана либо не засчитана. Каждая связка прогоняется 330 раз, публикуется точность и половина ширины 95-процентного доверительного интервала — то самое число со знаком ±, которое показывает, насколько результат может гулять в обе стороны от напечатанного. Прогоны идут через открытую обвязку Harbor, а сам проект поддержан Стэнфордом и Laude Institute.

Название строки в этом зачёте состоит из двух частей — «Claude Code с Opus 5», «Codex с GPT-5.6 Sol», «Grok Build с Grok 4.6». Число относится к связке целиком: к модели вместе с агентной обвязкой, которая читает файлы, запускает команды и решает, когда остановиться. Ту же модель в другой обвязке зачёт не измерял, поэтому переносить процент на «модель саму по себе» нельзя.

Исключение из этого правила есть, и оно полезное. В зачёте SWE-bench Bash Only у всех участников одинаковая обвязка mini-SWE-agent, поэтому там сравниваются именно модели. Самая свежая заявка в том зачёте датирована 26 февраля 2026 года, поэтому раздел с этими числами ниже подан как история вопроса.

Стоимость прогона в таблице Terminal-Bench — это сумма за все 330 попыток, а не цена одной задачи. Она показывает, сколько связка тратит на дорогу к ответу, и считается отдельно от ставки за миллион токенов.

Топ нейросетей для кода: таблица Terminal-Bench 4.0

Ниже таблица этого зачёта. Колонка ДИ в её шапке — тот самый доверительный интервал. Источник — Terminal-Bench 4.0, таблица создана 27 августа и обновлена 29 августа 2026 года; числа сняты с таблицы зачёта проекта.

Место Обвязка и модель Режим Решено, % 95 % ДИ, ± Прогонов Стоимость прогона, $
1 Claude Code, Opus 5 max 51,82 3,39 330 5969
2 Claude Code, Fable 5 max 44,55 3,85 330 7265
3 Claude Code, GLM-5.3 max 41,82 3,23 330 2728
4 Codex, GPT-5.6 Sol max 37,27 3,78 330 2542
5 Claude Code, Opus 4.8 max 23,64 3,56 330 6481
6 Codex, GPT-5.6 Terra max 21,52 3,25 330 1734
7 Grok Build, Grok 4.6 high 20,3 3,09 330 3592
8 Codex, GPT-5.6 Luna max 17,27 2,85 330 347
9 Grok Build, Grok 4.5 high 12,42 2,62 330 2094
9 Claude Code, Sonnet 5 max 12,42 3,06 330 9604

Читается таблица так. Первое место оторвано от остальных: 51,82 % — единственный результат выше половины задач. Второе и третье места стоят рядом, и доверительные интервалы Fable 5 и GLM-5.3 перекрываются: разброс одной строки накрывает результат другой, поэтому порядок между этими двумя строками зачёт не разделяет. Девятое место поделили Grok 4.5 и Claude Sonnet 5 — у них ровно одинаковая точность 12,42 %.

Колонка стоимости добавляет к картине то, чего не видно в процентах. Прогон из 330 задач у первой строки обошёлся в 5969 долларов, у второй — в 7265, а у Claude Sonnet 5 при точности 12,42 % — в 9604 доллара, больше всех в таблице. Обратный край тоже показателен: связка Codex с GPT-5.6 Luna прошла те же 330 задач за 347 долларов и решила 17,27 % — больше, чем две нижние строки, стоившие в шесть и в двадцать семь раз дороже.

Какая нейросеть лучше для программирования по сводному зачёту

Artificial Analysis прогоняет модели сама, через публичные API, и складывает результат девяти зачётов — отдельных наборов заданий с проверяемым ответом — в один индекс. Веса групп внутри индекса заданы явно: агентные задачи — 34 %, код — 24 %, научное рассуждение — 24 %, общие знания — 18 %. Кодовая четверть собрана из двух прогонов: Terminal-Bench версии 2.1 (89 задач, три повтора, вес 16 %) и SciCode (288 подзадач, три повтора, вес 8 %). Из этих же двух прогонов считается отдельная колонка Coding Index.

Условия прогона одинаковые для всех: температура 0 у обычных моделей и 0,6 у рассуждающих, запрос без примеров решения, счёт по схеме pass@1 — то есть засчитывается только ответ с первой попытки, вторая попытка модели не даётся. Источник отдельно называет ограничение своего индекса: все задания англоязычные, многоязычность он меряет другими наборами и в индекс не включает.

Модель и режим Coding Index Intelligence Index Agentic Index
GPT-5.6 Sol (xhigh) 78,3 59,0 53,6
Claude Opus 5 (max) 78,0 63,1 59,2
GPT-5.6 Sol (max) 77,4 60,9 57,8
GPT-5.6 Sol (high) 77,2 57,3 50,6
Grok 4.6 (high) 76,8 60,9 58,7
GPT-5.6 Terra (max) 76,7 56,6 50,2
Claude Fable 5 (max) 76,5 62,1 56,6
Kimi K3 (max) 76,2 59,7 54,3
Gemini 3.7 Flash (high) 76,1 56,0 45,1
GLM-5.3 (max) 74,8 59,5 59,1
Grok 4.5 (high) 72,4 55,8 48,9
Claude Sonnet 5 (max) 71,5 55,3 49,7
GPT-5.6 Luna (max) 71,4 52,3 46,9

Источник — Artificial Analysis, Intelligence Index v4.1.1, дата забора 30 августа 2026 года, таблица зачёта моделей. В таблице выше — выборка из тридцати верхних строк снимка: модели каталога GEN202 и ближайшие к ним по коду.

Разрыв здесь другой по масштабу. От верхней строки Coding Index до нижней в этой выборке — меньше семи баллов, тогда как в Terminal-Bench верх и низ различаются вчетверо. Причина в длине задания: короткие задачи с автоматической проверкой берут почти все крупные модели, а длинная работа в терминале, где надо самому решать, что делать дальше, расходится сильно.

Ещё одна величина, которую стоит прочитать отдельно, — режим усилия. У GPT-5.6 Sol в снимке их несколько, и по Coding Index уровни стоят вплотную: 78,3 у xhigh, 77,4 у max, 77,2 у high. По общему индексу те же три уровня расходятся заметнее — 59,0, 60,9 и 57,3. У Claude Opus 5 максимальный режим даёт 78,0 по коду и 63,1 по общему индексу — лучший общий результат снимка.

Семейство Gemini представлено в этом снимке следующей версией: Gemini 3.7 Flash в режиме high набирает 76,1 по коду. Модель Gemini 3.6 Flash, которая есть в каталоге GEN202, стоит в общей текстовой арене — 1481 очко при 20 190 голосах (Arena, Text Arena, снимок 27 августа 2026 года); это зачёт по тексту в целом, а не по коду.

Собрать сайт или приложение: лучшие нейросети для создания сайтов

WebDev Arena устроена как слепое парное голосование. Человек пишет запрос — сделать работающую веб-страницу или приложение, — получает два результата без названий и выбирает тот, который ему больше подходит. Снимок от 21 августа 2026 года собран из 603 789 голосов по 121 модели; числа сняты с таблицы зачёта WebDev.

Место Модель Оценка (Elo) Голосов
1 Claude Opus 5 (max) 1691 ±9 8 116
2 Kimi K3 (max) 1674 ±11 4 546
3 Qwen3.8 Max 1669 ±13, предварительно 3 212
4 Claude Opus 5 (high) 1663 ±8 8 659
5 Grok 4.6 (high) 1629 ±17, предварительно 1 523
6 Claude Fable 5 1626 ±8 8 382
7 GPT-5.6 Sol (xhigh, обвязка Codex) 1619 ±8 9 499
8 GLM-5.3 (max) 1599 ±15 1 916
9 Qwen3.8 27B 1595 ±13 2 464
10 Gemini 3.7 Flash (high) 1587 ±13, предварительно 2 552
17 Grok 4.5 1556 ±8 6 325

Пометка «предварительно» стоит у источника там, где голосов пока мало: у третьего, пятого и десятого места их от полутора до трёх тысяч против восьми-девяти тысяч у строк Claude и GPT-5.6. Отдельно в той же таблице идут строки с пометкой AutoEval — GLM-5.3 Flash с 1634 очками, hy4-preview с 1633 и Qwen3.8 Flash Next с 1617: их оценка получена автоматической процедурой, а не живыми голосами, поэтому места в общем зачёте и числа голосов у них нет.

Работа над интерфейсом — единственная из разобранных здесь, где зачёт опирается на человеческий выбор, а не на прохождение тестов. Для сборки страницы это уместно: тесты не отличают аккуратную вёрстку от кривой, а голосующий отличает.

История вопроса: SWE-bench, Aider polyglot и LiveCodeBench

Три зачёта по коду, которые чаще всего цитируют в подборках, к августу 2026 года остановились. Их числа полезны как история, а не как ответ на вопрос «что сейчас».

SWE-bench ведут исследователи Принстона и Стэнфорда. Модели дают настоящую заявку об ошибке из открытого репозитория и просят внести правку; правка засчитывается, если проходят тесты проекта. Наборы такие: основной — 2294 задачи из 12 репозиториев на Python, Verified — 500 отобранных людьми, Bash Only — 500 задач в одинаковом окружении mini-SWE-agent, Lite — 300 задач для дешёвой проверки, Multilingual — 300 задач из 42 репозиториев на девяти языках, Multimodal — 517 задач с изображениями в описании. Самая свежая заявка на таблице зачёта датирована 26 февраля 2026 года.

Верх зачёта Bash Only в этом снимке: Claude 4.5 Opus — 76,8 % решённых задач при 0,75 доллара за задачу, Gemini 3 Flash — 75,8 % при 0,36, MiniMax M2.5 — 75,8 % при 0,07, Claude 4.6 Opus — 75,6 % при 0,55, GPT 5.2 Codex — 72,8 % при 0,45, Claude 4.5 Sonnet — 71,4 % при 0,66.

Aider polyglot проверял модели на 225 упражнениях с Exercism — открытого сайта с учебными задачами по программированию — на шести языках: C++, Go, Java, JavaScript, Python и Rust. Считались две величины — доля решённых задач со второй попытки и доля случаев, где модель оформила правку в применимом виде. Верх таблицы: gpt-5 в режиме high — 88,0 % решённых при 91,6 % верного формата правки, o3-pro — 84,9 и 97,8, gemini-2.5-pro с окном размышления 32k — 83,1 и 99,6, claude-opus-4 с тем же окном — 72,0 и 97,3. В файле таблицы зачёта 69 записей, прогоны идут с 21 декабря 2024 года по 3 октября 2025-го; моделей 2026 года там нет.

LiveCodeBench собирает задачи с Codeforces, LeetCode и AtCoder — площадок с соревнованиями по программированию — и отбирает их по дате публикации, чтобы условия не попали в обучающие данные. В публичных данных таблицы зачёта 28 моделей, а отсечки дат заканчиваются на 1 мая 2025 года; самые свежие участники там уровня o3-mini.

Все три зачёта отвечают на вопрос о прошлом поколении моделей. Свежую картину дают Terminal-Bench 4.0, Coding Index у Artificial Analysis и WebDev Arena — три раздела выше.

Правка чужого кода: что именно меряют зачёты

Правка чужого проекта отличается от написания файла с нуля двумя вещами: надо понять непрочитанный код и надо выдать изменение в применимом виде. Обе вещи в зачётах измерены, только в разных.

Применимость правки — это отдельная колонка Aider polyglot, и она расходится с колонкой качества. У gpt-5 в режиме high самая высокая доля решённых задач — 88,0 %, а формат правки верный в 91,6 % случаев; у gemini-2.5-pro решено меньше, 83,1 %, зато формат верен в 99,6 % (Aider AI, последний прогон 3 октября 2025 года). Расстояние между 99,6 и 91,6 — это и есть доля случаев, когда изменение приходится доводить руками вместо того, чтобы применить его к файлу как есть.

Понимание чужого проекта меряет SWE-bench: там модель работает не с выдуманным заданием, а с настоящей заявкой из репозитория, и результат проверяют тесты самого проекта. Зачёт Bash Only ставит всех в одинаковое окружение, поэтому его числа сравнивают именно модели: 76,8 % у Claude 4.5 Opus против 71,4 % у Claude 4.5 Sonnet на дату 26 февраля 2026 года.

Сегодняшнее поколение на этой работе видно через Terminal-Bench 4.0, где правка чужого кода входит в задачи вместе со всем остальным, что делается в терминале. Верх таблицы — Claude Opus 5 с 51,82 %, дальше Claude Fable 5 с 44,55 % (снимок 29 августа 2026 года). Обе модели есть в каталоге GEN202, обе вызываются одним и тем же ключом.

Работа в терминале и агентные задачи

Агентная работа — это задача, которую модель ведёт сама: читает файлы, запускает команды, смотрит на вывод и решает, что делать дальше. Именно её меряет Terminal-Bench, и именно она весит больше всего в сводном индексе Artificial Analysis — 34 % против 24 % у кода.

Порядок по колонке Agentic Index на снимке 30 августа 2026 года: Claude Opus 5 в режиме max — 59,2, GLM-5.3 в режиме max — 59,1, Grok 4.6 в режиме high — 58,7, GPT-5.6 Sol в режиме max — 57,8, Claude Fable 5 — 56,6, Kimi K3 — 54,3, GPT-5.6 Sol в режиме xhigh — 53,6, Claude Sonnet 5 — 49,7, Grok 4.5 — 48,9, GPT-5.6 Luna — 46,9.

GLM-5.3 расходится между колонками сильнее остальных: по агентной он идёт вторым, а по Coding Index — десятым в той же выборке, 74,8. В Terminal-Bench 4.0 та же модель занимает третье место с 41,82 % и проходит 330 задач за 2728 долларов — вдвое дешевле первой строки таблицы и почти втрое дешевле второй. Для длинной агентной работы это соотношение важнее места в списке.

Уровень усилия — второй рычаг, который видно прямо в таблицах. У Grok 4.6 в индексе Artificial Analysis три уровня, у Claude Opus 5 — пять, и разброс общего индекса внутри одной модели больше десяти баллов: 63,1 в режиме max против 52,5 в режиме low. Выбирая модель под агентную задачу, вы выбираете и режим, в котором она будет работать.

Объяснение незнакомого кода

Объяснение чужого файла устроено обратно генерации: на вход идёт много текста, на выходе — короткий разбор. Зачёты по коду меряют другое — доведение задачи до конца и прохождение тестов, — а понятность объяснения проверяется на своём материале за один запрос. Выбор здесь опирается на две измеримые вещи: сколько текста модель принимает за раз и сколько стоит вход.

Вход дешевле выхода у всех восьми текстовых моделей каталога, а на разборе чужого кода перекос ещё сильнее: вы отправляете тысячи строк, а получаете абзац. Самый дешёвый вход — у GPT-5.6 Luna: 18 ₽ за миллион входных токенов при официальной цене разработчика 0,2 доллара. Дальше идёт Gemini 3.6 Flash с 135 ₽, а за ним Claude Sonnet 5 и Grok 4.5 с одинаковым входом — 180 ₽ за миллион токенов.

Разбор с картинками — отдельный случай. Gemini 3.6 Flash принимает на вход текст, картинки, звук и видео, три модели Claude и три уровня GPT-5.6 — текст и картинки. Скриншот с ошибкой в терминале или снимок экрана с интерфейсом кладётся в тот же запрос, что и код.

Длинный контекст: большой репозиторий целиком

Размер окна контекста решает, поместится ли проект в один запрос. По каталогу GEN202 картина такая: у трёх уровней GPT-5.6 окно 1 050 000 токенов и ответ до 128 000; у трёх моделей Claude — 1 000 000 и ответ до 128 000; у Gemini 3.6 Flash — 1 000 000 и ответ до 64 000; у Grok 4.5 — 500 000 токенов.

Второе, что меняется на длинном запросе, — ставка. У трёх уровней GPT-5.6 порог второй ступени стоит на 272 000 входных токенов и срабатывает строго выше него: официальная цена Luna меняется с 0,2 и 1,2 доллара на 0,4 и 1,8, у Terra — с 2 и 12 на 4 и 18, у Sol — с 5 и 30 на 10 и 45. Grok 4.5 переключается на повышенную ставку с 200 000 токенов включительно: репозиторий такого размера в запросе считается уже по 4 и 12 долларов вместо 2 и 6. У Gemini 3.6 Flash и у трёх моделей Claude вторая ступень отсутствует: сколько бы кода ни ушло в один запрос, ставка не меняется.

Отсюда простое правило для работы с большим репозиторием: если запрос регулярно переваливает за 272 тысячи токенов, у моделей Claude счёт считается по одной ставке, а у GPT-5.6 и Grok — по повышенной. Как устроен счёт за токены и что попадает во вход, разобрано отдельно: что такое миллион токенов.

Проверяется это на своём репозитории: один и тот же запрос отправляется в две модели с разным окном, и сразу видно, где проект помещается целиком, а где его приходится разбивать на части.

Языки: Python, JavaScript и написание скриптов

Состав задач в зачётах показывает, на чём именно проверены модели. Основной набор SWE-bench — 2294 задачи из 12 репозиториев на Python; набор Multilingual — 300 задач из 42 репозиториев на девяти языках. Aider polyglot брал 225 упражнений на шести языках: C++, Go, Java, JavaScript, Python и Rust. LiveCodeBench собирал задачи с площадок соревнований по программированию — Codeforces, LeetCode и AtCoder. Terminal-Bench 4.0 проверяет работу в терминале целиком, и результат засчитывает набор тестов.

Разбивку по отдельным языкам свежие зачёты — Terminal-Bench 4.0 и Coding Index — публикуют одним общим числом. Практический вывод: под конкретный язык порядок моделей проверяется на своём материале. Возьмите настоящий файл из своего проекта, дайте одинаковое задание двум-трём моделям и сравните, что вернулось. В чате GEN202 для этого не нужно ни ключа, ни трёх подписок: модель выбирается в списке над полем ввода.

Короткие скрипты — та работа, где разница между верхом и низом зачётов минимальна. По Coding Index нижняя строка выборки, GPT-5.6 Luna, набирает 71,4 против 78,3 у верхней; при этом прогон Terminal-Bench у связки Codex с GPT-5.6 Luna стоил 347 долларов против 5969 у первого места. На однофайловой задаче с понятным результатом дешёвый уровень закрывает вопрос.

Лучшая бесплатная нейросеть для кода

Открытая лицензия означает, что у модели открытые веса: она выложена так, что её можно скачать и запустить на своём оборудовании, а лицензия говорит, на каких условиях это разрешено. Название лицензии в зачётах написано прямо рядом с названием модели, и по этому признаку топ бесплатных нейросетей для кода собирается из таблиц выше.

  • GLM-5.3 от Z.ai, лицензия MIT: третье место Terminal-Bench 4.0 с 41,82 % ±3,23 и восьмое место WebDev Arena с 1599 очками.
  • GLM-5.3 Flash, та же лицензия MIT: 1634 очка в WebDev Arena по автоматической оценке AutoEval.
  • Qwen3.8 27B от Alibaba, лицензия Apache 2.0: девятое место WebDev Arena, 1595 очков при 2 464 голосах.
  • hy4-preview от Tencent, лицензия Apache 2.0: 1633 очка в WebDev Arena по автоматической оценке.
  • DeepSeek V4 Pro и DeepSeek V4 Flash, лицензия MIT: 1582 и 1579 очков в WebDev Arena.
  • Kimi K3 от Moonshot идёт под собственной лицензией Kimi K3: второе место WebDev Arena с 1674 очками и 76,2 по Coding Index.

Снимки: Terminal-Bench 4.0 — 29 августа 2026 года, WebDev Arena — 21 августа 2026 года, Coding Index — 30 августа 2026 года.

Второй путь попробовать модель без счёта — чат на этой странице: первый ответ идёт за счёт сервиса, без регистрации. После входа начисляется 50 кредитов (25 ₽) — их хватает, чтобы прогнать своё задание через несколько моделей и сравнить ответы.

Сколько стоит работа модели над кодом

Код в GEN202 пишут те же восемь текстовых моделей, что и любой другой текст, и счёт у них идёт за токены: отдельно за то, что вы отправили, отдельно за то, что модель написала в ответ. Против официальной цены разработчика ставка GEN202 ниже на десять процентов, платить можно рублями, и один ключ открывает весь каталог.

Модель Официально, $ за млн вход / выход GEN202, вход GEN202, выход Контекст, токенов
GPT-5.6 Luna 0,2 / 1,2 18 ₽ 108 ₽ 1 050 000
GPT-5.6 Terra 2 / 12 180 ₽ 1080 ₽ 1 050 000
GPT-5.6 Sol 5 / 30 450 ₽ 2700 ₽ 1 050 000
Gemini 3.6 Flash 1,5 / 7,5 135 ₽ 675 ₽ 1 000 000
Grok 4.5 2 / 6 180 ₽ 540 ₽ 500 000
Claude Opus 5 5 / 25 450 ₽ 2250 ₽ 1 000 000
Claude Sonnet 5 2 / 10 180 ₽ 900 ₽ 1 000 000
Claude Fable 5 10 / 50 900 ₽ 4500 ₽ 1 000 000

Цены в рублях — за миллион токенов, они подставляются из каталога и меняются вместе с ним. Полный список моделей со ставками — в каталоге, текстовые модели с примерами вызова — на странице API языковых моделей, сравнение ставок с официальными — на странице цен.

Ставка за токен и итоговый счёт — разные вещи, и таблица Terminal-Bench показывает это лучше всего. Claude Sonnet 5 стоит за миллион токенов в два с половиной раза дешевле Claude Opus 5, а прогон из 330 задач обошёлся у него в 9604 доллара против 5969 у Opus 5 (снимок 29 августа 2026 года). Более слабая связка тратит больше попыток, и на длинной агентной работе экономия на ставке оборачивается ростом счёта. На коротких задачах всё наоборот: там перебирать нечего, и дешёвая ставка остаётся дешёвой.

Как раскладывать задачи между тремя моделями Claude, разобрано отдельно — какую модель Claude выбрать. Парное сравнение двух флагманов на живых заданиях — в разборе GPT-5.6 или Claude Fable 5.

Что брать под работу: сводная таблица

Числа в средней колонке разного рода: проценты — доля решённых задач с проверкой тестами, баллы индекса — сводная оценка по наборам заданий, а четырёхзначные числа — Elo, оценка из слепых голосов людей. Сравнивать их можно только внутри одной строки.

Работа Что показывают зачёты Источник и дата снимка
Задачи в терминале, длинная агентная работа Claude Opus 5 — 51,82 %, Claude Fable 5 — 44,55 %, GLM-5.3 — 41,82 % Terminal-Bench 4.0, 29 августа 2026
Короткие задачи с автоматической проверкой GPT-5.6 Sol (xhigh) — 78,3, Claude Opus 5 (max) — 78,0, GPT-5.6 Sol (max) — 77,4 Coding Index, Artificial Analysis, 30 августа 2026
Сайт или приложение целиком Claude Opus 5 (max) — 1691, Kimi K3 — 1674, Qwen3.8 Max — 1669 WebDev Arena, 21 августа 2026
Самостоятельное ведение задачи Claude Opus 5 — 59,2, GLM-5.3 — 59,1, Grok 4.6 — 58,7 Agentic Index, Artificial Analysis, 30 августа 2026
Правка чужого кода в применимом виде gemini-2.5-pro — 99,6 % верного формата, o3-pro — 97,8 %, gpt-5 (high) — 91,6 % Aider polyglot, прогон 3 октября 2025 — история вопроса
Правка по заявке из репозитория, одинаковая обвязка Claude 4.5 Opus — 76,8 %, Gemini 3 Flash — 75,8 %, Claude 4.6 Opus — 75,6 % SWE-bench Bash Only, заявка 26 февраля 2026 — история вопроса
Разбор большого файла при дешёвом входе GPT-5.6 Luna — 18 ₽ за миллион входных токенов Каталог GEN202
Репозиторий целиком в одном запросе GPT-5.6 — 1 050 000 токенов, Claude и Gemini 3.6 Flash — 1 000 000 Каталог GEN202

Общий разбор всех задач сразу — тексты, картинки, код, русский язык — собран в статье про лучшую нейросеть под задачу.

FAQ

Какая нейросеть лучше для программирования? Самая лучшая нейросеть для программирования по свежему зачёту на реальной работе в терминале — Claude Opus 5: 51,82 % решённых задач против 44,55 % у следующей строки (Terminal-Bench 4.0, 29 августа 2026 года). По сводному зачёту коротких задач верх делят GPT-5.6 Sol с 78,3 и Claude Opus 5 с 78,0 балла Coding Index (Artificial Analysis, 30 августа 2026 года). Разные зачёты дают разный ответ, потому что меряют разную работу.

Какая лучшая нейросеть для кода, если считать по деньгам? Смотреть надо не на ставку за миллион токенов, а на стоимость всей работы. В Terminal-Bench прогон из 330 задач стоил 5969 долларов у Claude Opus 5 при 51,82 % решённых и 2728 долларов у GLM-5.3 при 41,82 % — при вдвое меньшей цене прогона результат ниже ровно на десять процентных пунктов. Самая дешёвая строка таблицы, Codex с GPT-5.6 Luna, прошла те же задачи за 347 долларов и решила 17,27 %.

Какая нейросеть лучше для генерации кода с нуля? На задании «собери работающий сайт или приложение» люди в слепом голосовании ставят первым Claude Opus 5 в режиме max — 1691 очко при 8 116 голосах, следом Kimi K3 с 1674 и Qwen3.8 Max с 1669 (WebDev Arena, 21 августа 2026 года).

Лучшая бесплатная нейросеть для кода — какая? Из моделей с открытой лицензией выше всех в зачётах стоит GLM-5.3 под лицензией MIT: третье место Terminal-Bench 4.0 с 41,82 % и восьмое место WebDev Arena с 1599 очками. Рядом Qwen3.8 27B под Apache 2.0 — девятое место WebDev Arena, 1595 очков. Попробовать платные модели без счёта можно в чате на этой странице: первый ответ идёт за счёт сервиса.

Лучшая нейросеть для написания кода на Python — какая? Разбивку по языкам свежие зачёты дают одним общим числом, а состав задач у них такой: основной набор SWE-bench — 2294 задачи из 12 репозиториев на Python, Aider polyglot — 225 упражнений на C++, Go, Java, JavaScript, Python и Rust. Под свой язык и под свой способ работы с кодом порядок проверяется на своём файле: одинаковое задание в две-три модели и сравнение ответов.

Какая нейросеть лучше для создания сайта? WebDev Arena — единственный из разобранных зачётов, где оценивают именно результат сборки страницы, и там верх у Claude Opus 5 (1691), Kimi K3 (1674) и Qwen3.8 Max (1669). Из каталога GEN202 в первой десятке этого зачёта стоят Claude Opus 5, Claude Fable 5 (1626) и GPT-5.6 Sol в обвязке Codex (1619).

Почему в разных топах нейросетей для кода разные победители? Потому что зачёты меряют разное и по-разному. Terminal-Bench считает долю доведённых до конца задач в терминале и оценивает связку «агентная обвязка и модель» целиком. Coding Index у Artificial Analysis собран из коротких заданий с автоматической проверкой. WebDev Arena считает голоса людей. Плюс дата: SWE-bench, Aider polyglot и LiveCodeBench остановились в феврале 2026-го, октябре 2025-го и мае 2025 года — их числа описывают прошлое поколение моделей.

Можно ли сравнить несколько моделей на одном и том же коде? Да, и это самый быстрый способ выбрать. GEN202 даёт один ключ ко всему каталогу и общий баланс в рублях: одно и то же задание отправляется в Claude Opus 5, в GPT-5.6 Sol и в Gemini 3.6 Flash, а дальше вы сравниваете, что вернулось. Для сравнения в чате ключ не нужен — модель выбирается в списке над полем ввода.

Чат с нейросетью онлайн

Claude, ChatGPT, Gemini, Grok и другие нейросети собраны в одном окне браузера, и разобрать свой код можно любой из них. Выберите нужную в списке над полем ввода и дайте задание с куском своего кода: первый ответ бесплатно и без регистрации. Больше моделей и история разговоров — в чате с нейросетью.