Сравнения

Лучшая русская нейросеть: зачёты по русскому языку

30.08.2026

Лучшая русская нейросеть выбирается здесь по замерам, где русский язык меряется отдельно от английского. Слепые голоса людей на русских запросах, экзаменационные задания на русском, олимпиадная математика по-русски и российская арена, в которой зарубежные и российские модели стоят в одной таблице, — четыре зачёта, и у каждого числа ниже стоит имя источника и дата снимка — день, когда числа сняли со страницы зачёта. Рейтинги живые, поэтому дата — часть факта.

Слепой голос устроен так: человеку показывают два ответа на его же вопрос и не говорят, какая модель что написала, а он выбирает тот, который больше подходит. Сотни тысяч таких выборов пересчитываются в одно число на модель — это и есть её рейтинг Elo, названный по шахматной шкале: чем число больше, тем чаще выбирают ответы этой модели. Второе число рядом, доверительный интервал, показывает пределы, в которых рейтинг может гулять вверх и вниз, и чем эти пределы уже, тем точнее известно место модели. Русский срез такой арены — отдельный подсчёт по тем голосам, где человек писал свой вопрос по-русски.

Дальше идёт разбор по работам: повседневный разговор, рассуждение, длинный текст, код, творческие задачи. Там же — российские сервисы, которые ищут по этому запросу: ГигаЧат, Алиса, Шедеврум и Kandinsky. И цены за русский текст в рублях, за миллион токенов: токены — куски слов, которыми модели считают объём работы, и счёт идёт отдельно за отправленный текст и отдельно за полученный ответ.

Первые строки русского зачёта — Claude Fable 5, Gemini 3.6 Flash и GPT-5.6 — отвечают по-русски в чате ниже на странице, вход для этого не нужен.

Коротко: какая нейросеть лучше всех понимает русский

Верх свежего зачёта по русскому языку занимает Claude Fable 5. В категории Russian на Arena у неё 1519 очков при доверительном интервале ±12 и 2 547 голосах — первая строка таблицы (Arena, Text Arena, срез Russian, снимок 27 августа 2026 года). Рядом стоят Gemini 3.7 Flash в режиме high с 1517 ±24 и пометкой источника «предварительно» и Muse Spark 1.2 в режиме xHigh с 1512 ±32. Дальше идут две модели Anthropic с одинаковой оценкой 1507: Claude Opus 4.7 в режиме high и Claude Opus 4.6.

Рассуждение по-русски меряет отдельный живой зачёт, MERA Reason. Там первая строка — Claude Opus 4.8 с общим баллом 80,82 из ста, вторая — gemma-4-31B-it с 73,94, третья — Qwen3.5-122B-A10B с 67,36 (MERA Reason, обновление 30 июля 2026 года).

Экзаменационный зачёт MERA даёт третий порядок. В его таблице первая строка — Claude-Opus-4.6 с общим баллом 0,862 по шкале от нуля до единицы, вторая — замер живого человека с 0,852, третья — GPT-5.4 с 0,821. Числа сняты из копии страницы в веб-архиве от 11 апреля 2026 года: сам сайт MERA на момент подготовки страницы отдаёт сообщение о технических работах.

Российские модели померены одной меркой с зарубежными на llmarena.ru. Выше всех российских там стоит Alice AI LLM от Яндекса — 1083 очка и ранг 11, следом T-pro-it-2.0 от Т-Банка с 1036, GigaChat 2 Max от Сбера с 999 и YandexGPT 5.1 Pro с 997. Таблица пересчитана 18 апреля 2026 года, и её числа описывают апрельскую картину.

Четыре зачёта дают четыре разные верхние строки, и это не противоречие: они меряют разную работу и собраны на разных составах участников. Складывать места из разных таблиц в один список нельзя — сравнивать числа можно только внутри одной. Дальше каждый зачёт разобран отдельно, с методикой и таблицами.

Устройство замеров: какой индекс говорит о русском языке

Сводный индекс Artificial Analysis, на который чаще всего ссылаются подборки моделей, собран на англоязычных текстовых заданиях — это сказано на странице методики самого источника. Многоязычность там меряется отдельным набором, Artificial Analysis Multilingual Index на основе Global-MMLU-Lite — это экзаменационные вопросы с выбором ответа, переведённые на разные языки, примерно 400 вопросов на язык. Список языков этого набора такой: английский, китайский, хинди, испанский, французский, арабский, бенгальский, португальский, индонезийский, японский, суахили, немецкий, корейский, итальянский, йоруба, бирманский. Русский язык меряют другие зачёты, и они разобраны ниже.

Отсюда правило чтения любой подборки: число из сводного индекса описывает работу модели на англоязычных заданиях, а про русский язык говорят таблицы, собранные на русском материале.

Таких таблиц с числами 2026 года четыре, и вот они рядом.

Зачёт Что меряет Дата данных Кто ведёт
Arena, Text Arena, срез Russian слепые парные голоса живых людей на русских запросах снимок 27 августа 2026 Arena Intelligence
MERA Reason рассуждение и олимпиадная математика на русском, 4 набора заданий обновление 30 июля 2026 Альянс в сфере ИИ
MERA, основной зачёт по тексту 15 закрытых задач на русском: знания, логика, математика, код, ЕГЭ снимок из веб-архива 11 апреля 2026 Альянс в сфере ИИ
LLM Arena, llmarena.ru слепые парные голоса на русском, российские и зарубежные модели в одной таблице пересчёт 18 апреля 2026 проект llmarena.ru

Остальные семь найденных замеров русского языка собраны в 2024 и 2025 годах. Они разобраны ниже отдельным разделом как история вопроса: их таблицы описывают модели своего времени.

Лучшая нейросеть онлайн на русском: слепые голоса живых людей

Arena устроена как слепое парное голосование. Посетитель пишет свой запрос, получает ответы двух моделей без названий и выбирает тот, который ему больше подходит; названия раскрываются после голоса. Категория Russian — это те же живые запросы, отобранные по языку: набором заданий здесь служит сам поток вопросов, с которыми люди приходят.

Снимок от 27 августа 2026 года: 359 моделей и 804 885 голосов по русскому языку. Числа сняты чтением таблицы русской категории. Число голосов на странице замерено двумя способами и разошлось: рядом с датой стоит 804 885, а сумма по строкам во внутренних данных страницы даёт 1 170 032. Здесь используется то, что печатает сама страница; построчные числа в обоих способах совпали до единицы.

О надёжности числа в этой таблице говорят две колонки. «Разброс места» — диапазон мест, в котором модель может стоять с учётом неопределённости. Соседняя колонка — сам рейтинг и его доверительный интервал.

Место Разброс места Модель Разработчик Оценка ± 95 % ДИ Голосов
1 1–10 claude-fable-5 Anthropic 1519 ±12 2 547
2 1–26 gemini-3.7-flash-high Google 1517 ±24, предварительно 616
3 1–42 muse-spark-1.2 (xHigh) Meta 1512 ±32 329
4 1–21 claude-opus-4-7-high Anthropic 1507 ±9 6 055
5 1–21 claude-opus-4-6 Anthropic 1507 ±7 8 227
6 1–22 claude-opus-4-6-high Anthropic 1506 ±8 7 792
7 1–26 gemini-3-pro Google 1501 ±9 4 791
8 1–31 claude-opus-5-high Anthropic 1500 ±11 3 392
9 2–26 gemini-3.1-pro-preview Google 1499 ±7 10 833
10 2–29 claude-opus-4-7 Anthropic 1498 ±9 6 219
11 2–36 claude-opus-4-8-high Anthropic 1495 ±9 4 856
12 1–45 claude-opus-5-max Anthropic 1493 ±15 1 604
13 2–42 gpt-5.6-sol-xhigh OpenAI 1492 ±13 2 233
14 2–42 muse-spark-1.1 Meta 1492 ±13 2 339
15 2–42 gemini-3.5-flash-high Google 1491 ±11 3 327
16 2–42 gemini-3.5-flash-medium Google 1491 ±11 3 183
17 4–38 gpt-5.4-high OpenAI 1490 ±8 6 507
18 2–50 kimi-k3-max Moonshot 1488 ±14 1 783
19 2–49 gemini-3.6-flash-high Google 1487 ±13 2 088
20 5–45 gemini-3-flash Google 1486 ±10 3 913
21 5–45 claude-opus-4-8 Anthropic 1486 ±9 4 748
22 2–52 qwen3.8-max Alibaba 1485 ±16 1 361
23 1–79 qwen3.7-max-preview Alibaba 1485 ±32 374
24 8–45 gpt-5.5-high OpenAI 1484 ±8 6 274
25 5–57 muse-spark Meta 1482 ±16 1 464

Колонка «Разброс места» — самое полезное, что есть в этой таблице, и читать её нужно раньше, чем места. Она показывает, в каком диапазоне мест модель может находиться с учётом неопределённости. У первой строки это 1–10, у второй 1–26, у третьей 1–42. То есть верхняя десятка здесь — не порядок от первого к десятому, а группа моделей, между которыми зачёт разницы не проводит.

Причина широких интервалов названа прямо: голосов по русскому в десять раз меньше, чем в общем зачёте. У верхних строк русского среза интервал составляет от ±7 до ±32, тогда как в общем зачёте — от ±3 до ±5. У строк, набравших несколько сотен голосов, разница между соседними местами внутри интервала неразличима: Gemini 3.7 Flash в режиме high стоит вторым при 616 голосах, Muse Spark 1.2 — третьим при 329, и обе строки источник помечает как предварительные или снабжает широким интервалом.

Практический вывод из таблицы такой. Верх русского зачёта занят семейством Claude: восемь строк из первых двенадцати. Рядом с ними стоят Gemini разных версий — семь строк в первой двадцатке. Дальше идут GPT-5.6 Sol, GPT-5.4, Kimi K3 и Qwen. Голосуют за эти ответы живые люди, задававшие свои вопросы по-русски, поэтому зачёт отражает именно повседневную переписку, а не экзаменационные задания.

Модели каталога GEN202 в русском срезе

Модели каталога GEN202 стоят в той же таблице. Ниже их строки из того же снимка от 27 августа 2026 года — те, что попали в верхние сорок мест русского среза.

Модель в каталоге Строка зачёта Место в русском срезе Оценка ± ДИ Голосов
Claude Fable 5 claude-fable-5 1 1519 ±12 2 547
Claude Opus 5 claude-opus-5-high 8 1500 ±11 3 392
Claude Opus 5 claude-opus-5-max 12 1493 ±15 1 604
GPT-5.6 Sol gpt-5.6-sol-xhigh 13 1492 ±13 2 233
Gemini 3.6 Flash gemini-3.6-flash-high 19 1487 ±13 2 088
Grok 4.5 grok-4.5 33 1474 ±12 2 590
Claude Sonnet 5 claude-sonnet-5-high 36 1470 ±11 3 001
GPT-5.6 Terra gpt-5.6-terra-xhigh 38 1469 ±13 2 285

Расстояние от первой строки этого списка до последней — 50 очков. Первые пять строк лежат в пределах 32 очков друг от друга при интервалах от ±11 до ±15, то есть по этому зачёту они стоят одной группой.

Все эти модели открываются одним ключом и одним рублёвым счётом, а в чате выбираются в списке над полем ввода. Это и есть самый прямой способ проверить порядок из таблицы на своём задании: одинаковый русский текст уходит в две-три модели, и ответы сравниваются рядом.

Русский срез против общего зачёта: где порядок расходится

Общий зачёт Arena снят в тот же день, 27 августа 2026 года, и собран из 7 922 078 голосов по 395 моделям. Сравнение двух таблиц показывает, что именно даёт фильтр по языку.

Модель Место в общем зачёте Оценка в общем зачёте Место в русском срезе Оценка в русском срезе
claude-fable-5 1 1507 ±5, 25 824 голоса 1 1519 ±12, 2 547 голосов
claude-opus-4-6-high 2 1505 ±4, 72 104 голоса 6 1506 ±8, 7 792 голоса
claude-opus-4-7-high 3 1502 ±4, 60 136 голосов 4 1507 ±9, 6 055 голосов
muse-spark-1.2 (xHigh) 4 1498 ±10, 3 247 голосов 3 1512 ±32, 329 голосов
claude-opus-5-high 7 1492 ±5, 31 570 голосов 8 1500 ±11, 3 392 голоса
gemini-3.7-flash-high 9 1490 ±8, 5 720 голосов 2 1517 ±24, 616 голосов
claude-opus-5-max 12 1488 ±6, 15 398 голосов 12 1493 ±15, 1 604 голоса
gpt-5.6-sol-xhigh 17 1482 ±5, 21 537 голосов 13 1492 ±13, 2 233 голоса
gemini-3.6-flash-high 19 1481 ±5, 20 190 голосов 19 1487 ±13, 2 088 голосов

Первое место совпадает: Claude Fable 5 стоит первым и там, и там. Дальше порядок расходится, и заметнее всего у Gemini 3.7 Flash в режиме high — девятая строка общего зачёта и вторая строка русского. Правда, в русской категории у неё 616 голосов против 5 720 в общем, а интервал ±24 против ±8, и источник помечает обе строки как предварительные.

Оценки в двух таблицах различаются: у Claude Fable 5 — 1519 в русском срезе против 1507 в общем, у Gemini 3.7 Flash в режиме high — 1517 против 1490, у Claude Opus 4.6 в режиме high — 1506 против 1505. Разница чисел между таблицами ничего не говорит о качестве: рейтинг Bradley–Terry — так называется способ пересчёта парных голосов в одно число — считается внутри своего набора голосов, и абсолютные значения двух наборов между собой не сравниваются. Сравнивать имеет смысл порядок строк, а не сами числа.

MERA: экзамен на русском из 23 заданий

MERA ведёт Альянс в сфере ИИ, и в описании проекта перечислены его участники: SberDevices, Sber AI, Yandex, Skoltech AI, MTS AI, НИУ ВШЭ и РАН. Это не голосование, а закрытый набор заданий: 23 задачи, из которых 15 основных с закрытыми ответами и 8 диагностических. Закрытым он назван потому, что правильные ответы нигде не опубликованы: подготовиться к ним заранее нельзя. Прогон идёт через переработанную версию открытого набора Language Model Evaluation Harness 0.4.8, а общий балл в таблице зачёта — это средний балл основных задач, без учёта диагностических; там, где у задачи несколько метрик, то есть несколько способов подсчёта, они сначала усредняются между собой.

Каждое имя в списке ниже — отдельный набор вопросов внутри MERA. Состав основных задач такой: MathLogicQA, MultiQ, PARus, RCB, ruModAr, ruMultiAr, ruOpenBookQA, ruTiE, ruWorldTree, RWSD, SimpleAr, BPS, CheGeKa, LCS, ruHumanEval, ruCodeEval, ruMMLU на 14 012 вопросов с выбором ответа, MaMuRAMu, USE с заданиями ЕГЭ, ruDetox, ruEthics, ruHateSpeech и ruHHH. То есть в один балл сведены школьный экзамен, логика, арифметика, код, работа с этикой и распознавание оскорблений — всё на русском.

Одну особенность методики надо назвать прямо: прогоны присылают сами команды в виде архива с логами, MERA их проверяет и публикует. Поэтому в таблице есть колонка с тем, кто прислал замер, и часть строк прислана самими разработчиками моделей. В таблице ниже эта колонка сохранена.

Числа сняты из копии страницы в веб-архиве от 11 апреля 2026 года. Сам сайт mera.a-ai.ru на момент подготовки этой страницы целиком отдаёт сообщение о технических работах, так что живых чисел с него снять нельзя. Архивная копия разобрана на 595 записей, верх таблицы полный. Шкала — от нуля до единицы.

Место Модель Кто прислал замер Общий балл ruMMLU
1 Claude-Opus-4.6 MERA 0,862 0,925
2 Human Benchmark, живой человек MERA 0,852 0,844
3 GPT-5.4 MERA 0,821 0,918
4 BerryLM-v2-reasoning-budget-low Wildberries и Russ 0,81 0,873
5 Qwen3-235B-A22B-Thinking-2507 MERA 0,795 0,861
6 Cotype Light 3 MWS AI 0,792 0,732
7 BerryLM-L Wildberries и Russ 0,775 0,825
8 Claude Opus 4.5 сам разработчик 0,763 0,901
9 Qwen3-30B-A3B-Thinking-2507 MERA 0,747 0,804
10 BerryLM-MT Wildberries и Russ 0,745 0,777
11 BerryLM Wildberries и Russ 0,739 0,754
12 Qwen3-32B MERA 0,731 0,821
13 GigaChat-3.1-Ultra GigaChat 0,712 0,814
16 GPT-5.2 сам разработчик 0,707 0,882
18 Claude 3.7 Sonnet llmarena.ru 0,682 0,845
19 Gemini 2.0 Flash llmarena.ru 0,678 0,82
20 DeepSeek-V3 llmarena.ru 0,677 0,8
24 Cotype Pro 2.5 MWS AI 0,671 0,905
25 GigaChat 2 Max GIGACHAT 0,67 0,795
27 T-pro-it-2.0 T-Tech 0,66 0,79

Вторая строка таблицы — точка отсчёта. «Human Benchmark» — это результат живого человека на тех же заданиях, который MERA публикует как точку отсчёта, и он равен 0,852. Выше него в апрельском снимке стоит одна строка: Claude-Opus-4.6 с 0,862. Всё остальное, включая GPT-5.4 с 0,821, идёт ниже человеческого результата.

Разбор одного балла на составляющие показывает, из чего он складывается. У первой строки, Claude-Opus-4.6, задания расходятся широко: SimpleAr — 1,0, MathLogicQA и ruMultiAr — по 0,998, BPS — 0,996, ruWorldTree — 0,996, ruTiE — 0,981, ruOpenBookQA — 0,98, LCS — 0,964, PARus — 0,934, RWSD — 0,931, MaMuRAMu — 0,926, ruMMLU — 0,925, ruHHH — 0,916, ruHateSpeech — 0,913, USE с заданиями ЕГЭ — 0,89, CheGeKa — 0,742 и 0,63, RCB — 0,632 и 0,623, MultiQ — 0,597 и 0,398, ruCodeEval — 0,471, 0,553 и 0,579, ruDetox — 0,393, ruEthics — 0,362, ruHumanEval — 0,23, 0,295 и 0,317.

Отсюда видно, что общий балл собран из очень разных по трудности задач: арифметика и подстановка берутся почти полностью, школьный экзамен даёт 0,89, а задания на код и на этику остаются в пределах от 0,23 до 0,579. Модель, у которой общий балл выше на сотую, может отличаться от соседней по строке совсем в другом месте набора.

Колонка ruMMLU полезна отдельно: это 14 012 вопросов с выбором ответа на русском, тот самый разрез, который в подборках называют «MMLU по-русски». По ней порядок местами другой, чем по общему баллу: у Cotype Pro 2.5 ruMMLU 0,905 — третий результат этой колонки в таблице выше, — а по общему баллу она занимает двадцать четвёртую строку с 0,671.

MERA Reason: рассуждение и олимпиадная математика по-русски

MERA Reason ведёт та же команда, но таблица зачёта лежит на Hugging Face Spaces и работает: снимок сделан на обновлении от 30 июля 2026 года, сам Space создан 17 июня 2026 года. Ссылка на источник — таблица зачёта MERA Reason.

Общий балл складывается из четырёх наборов заданий. Что меряет каждый, описано в коде таблицы:

  • ruAIME — 724 задачи американской математической олимпиады AIME за 1983–2025 годы, переведённые на русский. Ответ даётся числом, и засчитывается только точное совпадение с эталоном.
  • T-math — 310 задач Всероссийской олимпиады школьников и Московской олимпиады за 2005–2025 годы. Ответ засчитывается, если он математически равен эталонному, даже когда записан иначе.
  • Luzitania — 251 задание на русском, где к ответу надо прийти в несколько шагов рассуждения; засчитывается точное совпадение ответа.
  • MMReD — вопросы по длинному тексту, ответ на которые приходится собирать из разных его мест: 5 типов вопросов на 3 длины текста — 32, 64 и 128 тысяч токенов, — всего 750 вопросов. Пять взвешенных долей точных ответов сводятся в одно число гармоническим средним: провал в любом из пяти типов вопросов тянет итог вниз сильнее, чем высокий результат тянет его вверх.

Примеров решения модели в запросе не получают, а результат выражен долей выполненных заданий в процентах. В таблице 24 модели, состав участников — Anthropic, Google, Alibaba, Z.ai и DeepSeek.

Место Модель Общий балл ruAIME T-math Luzitania MMReD
1 Claude Opus 4.8 80,82 98,48 78,18 58,96 93,97
2 gemma-4-31B-it 73,94 95,03 78,83 43,43 91,86
3 Qwen3.5-122B-A10B 67,36 86,88 72,64 35,06 93,07
4 Qwen3.5-27B 65,54 87,71 69,38 31,47 96,36
5 GLM-5 63,8 90,06 67,1 29,48 93,01
6 Qwen3.5-35B-A3B 61,82 88,81 66,45 27,89 88,75
7 Qwen3.6-27B 61,02 91,71 65,47 25,1 91,96
8 DeepSeek-v4-Pro 60,18 88,67 67,43 23,11 94,94
9 DeepSeek-v4-Flash 56,03 86,88 61,89 22,71 80,69
10 Qwen3.6-35B-A3B 55,43 88,54 65,15 18,73 87,41
11 Qwen3-30B-A3B-Thinking-2507 51,78 87,85 63,84 18,33 69,95
12 Qwen3-Next-80B-A3B-Thinking 50,75 84,53 57,98 18,33 73,85
13 Qwen3-4B-Thinking-2507 46,65 77,76 50,49 16,73 72,07
14 Qwen3.5-9B 45,87 78,73 51,79 13,94 77,87
15 gemma-4-26B-A4B-it 38,44 77,62 61,24 28,29 16,24
16 gemma-4-E4B-it 35,74 55,52 31,92 10,76 85,61
17 Qwen3.5-4B 34,12 69,61 41,04 8,76 54,09
18 gemma-4-E2B-it 24,6 44,06 18,89 9,56 46,02

Строки этой таблицы читаются по столбцам не хуже, чем по общему баллу. Первая строка берёт 98,48 на олимпиадных задачах AIME и 58,96 на Luzitania — почти сорок пунктов разницы внутри одной модели. У gemma-4-26B-A4B-it картина обратная: 77,62 на ruAIME и 16,24 на MMReD, то есть задачи на длинном тексте она проходит совсем иначе, чем короткие математические.

Колонка Luzitania держится ниже остальных по всей таблице: 58,96 у первой строки, 43,43 у второй, 35,06 у третьей и 8,76 у семнадцатой. Многошаговое рассуждение на русском — то место, где верх таблицы отрывается от середины сильнее всего. Колонка MMReD, наоборот, у большинства верхних строк стоит в районе девяноста: работа с длинным русским текстом даётся ровнее.

Пометка в имени модели говорит о режиме работы: Thinking — вариант, который перед ответом рассуждает про себя, Instruct — вариант, который отвечает сразу. Конец таблицы занимают строки с пометкой Instruct: Qwen3-235B-A22B-Instruct-2507 — 6,61, Qwen3-30B-A3B-Instruct-2507 — 3,69, Qwen3-Next-80B-A3B-Instruct — 0,5, Qwen3-4B-Instruct-2507 — 0,34. Варианты тех же семейств с пометкой Thinking стоят выше: Qwen3-30B-A3B-Thinking-2507 — 51,78, Qwen3-Next-80B-A3B-Thinking — 50,75, Qwen3-4B-Thinking-2507 — 46,65. Две пометки внутри одного семейства разводят модель по разным концам таблицы.

Топ русских нейросетей: llmarena.ru, где мерка одна на всех

LLM Arena на llmarena.ru — единственный найденный зачёт, где российские и зарубежные модели стоят в одной таблице и померены одинаково. Устроен он так же, как Arena: люди сравнивают ответы двух моделей на русском и голосуют, рейтинг считается по модели Bradley–Terry в шкале Elo. Колонка «Ранг (UB)» — верхняя граница ранга, то есть лучшее место, на которое модель может претендовать: единица плюс число моделей, превосходящих её наверняка с учётом 95-процентного доверительного интервала. Поэтому у нескольких строк подряд стоит один и тот же ранг: между этими моделями зачёт разницы не проводит.

Числа сняты с открытых данных llmarena.ru, и сам источник печатает рядом сводку: 104 модели, 132 622 голоса, пересчёт 18 апреля 2026 года. Голосов здесь на порядок меньше, чем в русской категории Arena, поэтому интервалы широкие: у верхних строк от ±20 до ±39 при разнице между соседями в единицы пунктов. Верхние места источник сам показывает как неразличимые, ставя нескольким моделям подряд ранг «1».

Колонка лицензии делит модели надвое. Закрытая — модель работает только на серверах своего разработчика. Открытая — веса модели, то есть файлы обученной сети, выложены, и её разрешено скачать и запустить у себя.

Верх общего зачёта, снимок 18 апреля 2026 года:

Ранг (UB) Модель Организация Elo 95 % ДИ Голосов Лицензия
1 Gemini 3 Pro Preview Google 1210 +26 / −23 537 закрытая
1 Gemini Pro 2.5 Preview 03-25 Google 1196 +25 / −23 710 закрытая
1 GPT-5.4 OpenAI 1187 +39 / −34 292 закрытая
1 Gemini 3.1 Pro Preview Google 1181 +26 / −25 516 закрытая
1 Gemini Flash 2.5 Preview 04-17, thinking Google 1159 +28 / −30 422 закрытая
3 GPT-5.1 OpenAI 1148 +20 / −21 803 закрытая
4 DeepSeek V3.2 DeepSeek 1133 +21 / −20 797 открытая
5 GPT-5 Chat OpenAI 1129 +14 / −13 1 665 закрытая
5 DeepSeek V3.1 DeepSeek 1123 +17 / −18 1 044 закрытая
5 GPT-5.2 OpenAI 1114 +19 / −19 822 закрытая
7 Qwen3 Max Qwen 1113 +14 / −14 1 487 закрытая
7 Claude Sonnet 4.5 Anthropic 1108 +19 / −19 949 закрытая
7 Claude Opus 4.1 Anthropic 1108 +18 / −19 825 закрытая
9 Grok 4 xAI 1094 +14 / −15 1 435 закрытая

Российские модели в той же таблице, тот же снимок и та же методика:

Ранг (UB) Модель Организация Elo 95 % ДИ Голосов Лицензия
11 Alice AI LLM Яндекс 1083 +13 / −16 1 468 закрытая
27 t-tech/T-pro-it-2.0 Т-Банк 1036 +19 / −19 981 открытая
41 GigaChat 2 Max Сбер 999 +17 / −17 904 закрытая
42 YandexGPT 5.1 Pro Яндекс 997 +17 / −17 976 закрытая
46 GigaChat 2 Pro Сбер 989 +17 / −18 876 закрытая
47 RuadaptQwen2.5-32B-Pro-Beta RefalMachine 986 +20 / −20 749 открытая
51 GigaChat-Max-preview 4.0.26.20 Сбер 978 +15 / −15 1 381 закрытая
50 t-tech/T-pro-it-1.0 Т-Банк 973 +22 / −21 547 открытая
51 Vikhr-Nemo-12B-Instruct-R-21-09-24 Vikhrmodels 970 +20 / −18 859 открытая
66 YandexGPT Experimental Яндекс 945 +15 / −16 1 185 закрытая
63 t-tech/T-lite-it-1.0 Т-Банк 942 +22 / −21 595 открытая
66 GigaChat 2 Lite Сбер 938 +17 / −20 904 закрытая
66 YandexGPT 5 Pro Яндекс 936 +20 / −19 921 закрытая
76 YandexGPT 4 Pro Яндекс 912 +12 / −12 2 009 закрытая
83 YandexGPT 3 Pro Яндекс 888 +14 / −13 1 767 закрытая
91 MTSAIR/Cotype-Nano МТС 854 +18 / −17 1 009 открытая

Верхняя российская строка — Alice AI LLM с 1083 очками и рангом 11. От первой строки таблицы её отделяет 127 очков, от Claude Opus 4.1 и Claude Sonnet 4.5 — 25 очков при интервале +13 / −16 у самой Alice AI LLM и +19 / −19 у Claude Sonnet 4.5. Следом идут T-pro-it-2.0 от Т-Банка с 1036 и группа моделей Сбера и Яндекса в диапазоне от 999 до 936.

Эта же таблица разложена по видам работы, и разрезы полезны отдельно:

Разрез Голосов Первые строки
Код 31 822 Gemini 3 Pro Preview — 1240; GPT-5.4 — 1222; Gemini Pro 2.5 Preview 03-25 — 1188
Математика 13 772 Gemini Pro 2.5 Preview 03-25 — 1216; GPT-5.1 — 1157; DeepSeek R1 0528 — 1154; Claude Sonnet 4.5 — 1146; Alice AI LLM — 1135
Творческие задачи 26 132 GPT-5.4 — 1219; Gemini 3 Pro Preview — 1181; Gemini 3.1 Pro Preview — 1164
Наука 107 302 Gemini 3 Pro Preview — 1219; Gemini Pro 2.5 Preview 03-25 — 1215; Gemini 3.1 Pro Preview — 1183

В разрезе по математике Alice AI LLM стоит пятой строкой с 1135 очками, тогда как в общем зачёте той же таблицы у неё ранг 11 и 1083 очка. Разрез по науке — самый крупный по числу голосов, 107 302; разрез по математике — самый мелкий, 13 772.

Дату этого зачёта надо держать в голове при каждом его числе: таблица пересчитана 18 апреля 2026 года. Она отвечает на вопрос, как выглядели модели весной, а не что происходит сейчас.

ГигаЧат: что о нём говорят зачёты

ГигаЧат — русскоязычная нейросеть Сбера, и её строки есть в двух зачётах из четырёх.

В апрельском снимке MERA выше всех моделей Сбера стоит GigaChat-3.1-Ultra: общий балл 0,712 при ruMMLU 0,814, тринадцатая строка таблицы. Замер прислан командой GigaChat — это записано в самой таблице MERA в колонке о том, кто присылал прогон. Дальше в том же снимке идут GigaChat 2 Max с общим баллом 0,67 и ruMMLU 0,795 на двадцать пятой строке, GigaChat 2 Pro с 0,649 на двадцать восьмой, GigaChat Max с 0,588 на пятьдесят восьмой, GigaChat 2 с 0,541 на девяносто шестой, GigaChat-20B-A3B с 0,513, GigaChat Pro с 0,512, GigaChat-3.1-Lightning с 0,501 и GigaChat с 0,5 на сто тридцать шестой.

В llmarena.ru у Сбера самая высокая строка — GigaChat 2 Max с 999 очками и рангом 41, за ней GigaChat 2 Pro с 989 и GigaChat-Max-preview 4.0.26.20 с 978. Снимок от 18 апреля 2026 года.

Чего в этих числах не видно, показывают живые пробы. Автор канала «ХАБ. AI» в разборе российских сервисов отдельно останавливается на входе: чтобы открыть ГигаЧат, нужна учётная запись Сбербанка, и такой порядок входа он называет необычным для нейросетей. Автор канала Tema Romanov, давая ГигаЧату и Алисе одинаковые деловые задания — коммерческое предложение, резюме встречи, разбор документа, генерация картинок, — отметил простой интерфейс с кнопкой доработки полученного текста прямо в окне и превращение готового текста в подкаст с выбором дикторов и длительности. По его же наблюдению, надписи внутри сгенерированных ГигаЧатом картинок выходят разборчивыми: буквы на кадре он прочитал полностью.

Слепое голосование сравнивает текст ответа. Порядок входа, кнопки в окне переписки и подкасты показывает живая проба — эта часть работы сервиса видна в разборах, а не в таблицах.

Алиса и YandexGPT в зачётах

Алиса AI — чат Яндекса, и в llmarena.ru её строка называется Alice AI LLM. В снимке от 18 апреля 2026 года у неё 1083 очка, ранг 11 и 1 468 голосов — выше всех прочих российских моделей в этой таблице. В разрезе по математике той же таблицы она стоит пятой с 1135 очками.

Модели YandexGPT померены там же: YandexGPT 5.1 Pro — 997 очков и ранг 42, YandexGPT Experimental — 945, YandexGPT 5 Pro — 936, YandexGPT 4 Pro — 912 при 2 009 голосах, YandexGPT 3 Pro — 888, YandexGPT 3 Lite — 868.

Живая проба показывает, что стоит за числами. Автор канала Tema Romanov, задавая Алисе вопрос без отдельной команды на размышление, увидел, что она сама пошла в интернет, нашла подтверждения и привела их в ответе. Он же в другой задаче дал сервисам заведомо выдуманную новость и смотрел, что они с ней сделают: Алиса, по его описанию, приняла событие как случившееся и стала рассуждать дальше, а ГигаЧат подтянул к нему события примерно десятилетней давности. Автор «ХАБ. AI» на разборе скриншота получил от Алисы верный подсчёт времени сразу, а от ГигаЧата — после уточнения.

Отдельное сравнение Алисы с зарубежной моделью на живых заданиях собрано на странице Алиса или DeepSeek.

T-Pro, Cotype, BerryLM и другие российские модели

Российских моделей в замерах больше, чем два известных чата: в апрельском снимке MERA их строки начинаются с четвёртого места и дальше идут через всю таблицу.

Место в снимке Модель Кто прислал замер Общий балл ruMMLU
4 BerryLM-v2-reasoning-budget-low Wildberries и Russ 0,81 0,873
6 Cotype Light 3 MWS AI 0,792 0,732
7 BerryLM-L Wildberries и Russ 0,775 0,825
10 BerryLM-MT Wildberries и Russ 0,745 0,777
11 BerryLM Wildberries и Russ 0,739 0,754
13 GigaChat-3.1-Ultra GigaChat 0,712 0,814
24 Cotype Pro 2.5 MWS AI 0,671 0,905
25 GigaChat 2 Max GIGACHAT 0,67 0,795
27 T-pro-it-2.0 T-Tech 0,66 0,79
28 GigaChat 2 Pro GIGACHAT 0,649 0,745
33 Cotype, предварительная версия MTS AI 0,633 0,903
35 T-pro-it-1.0 T-Tech 0,629 0,768
37 Zero-Mistral-24B ZeroAgency 0,623 0,778
39 A-vibe Avito 0,618 0,686
43 RuadaptQwen-32B-instruct RCC MSU 0,615 0,737
89 T-lite-it-1.0 T-Tech 0,552 0,664
100 RuadaptQwen2.5-7B-Lite-v1 RCC MSU 0,536 0,64
120 T-lite-0.1 Т-Банк 0,51 0,549

Четвёртая строка всего снимка — BerryLM-v2-reasoning-budget-low от Wildberries и Russ с общим баллом 0,81. Выше неё стоят только Claude-Opus-4.6, замер живого человека и GPT-5.4. Шестая строка — Cotype Light 3 от MWS AI с 0,792. Замеры этих строк прислали сами разработчики, и в таблице MERA это указано колонкой.

У части российских строк колонка ruMMLU стоит заметно выше общего балла. У Cotype Pro 2.5 общий балл 0,671 при ruMMLU 0,905, у предварительной версии Cotype — 0,633 при ruMMLU 0,903. Вопросы с выбором ответа на русском эти модели берут на уровне верха таблицы, а сводный балл у них ниже за счёт остальных четырнадцати задач набора.

Шедеврум и Kandinsky: работа с картинками по русскому описанию

Шедеврум у Яндекса и Kandinsky у Сбера делают картинки и короткие ролики. Зачёты, разобранные выше, меряют текст; работу с картинками меряют собственные зачёты, и они устроены так же — слепое сравнение двух результатов по одному запросу.

Свежий зачёт по генерации изображений — Text to Image Arena у Artificial Analysis, где оценивающему показывают два изображения по одному запросу без названий, а рейтинг считается тем же методом Bradley–Terry и переводится в шкалу Elo. В снимке от 30 августа 2026 года первая строка — GPT Image 2 в режиме high с 1369,8 очка при 14 868 голосах, вторая — MAI-Image-2.6-Preview с 1350,6, третья — Reve 2.1 с 1322,4, четвёртая — Nano Banana 2 с 1320,6 при 16 027 голосах. Всего в зачёте 158 моделей.

Полный разбор картиночных зачётов с таблицами и ценами — на странице лучшая нейросеть для картинок. Видео разобрано отдельно: лучшие нейросети для видео. Работа с изображениями прямо на сайте — нейросеть для картинок.

История вопроса: семь замеров русского языка 2024 и 2025 годов

Семь остальных найденных зачётов по русскому собраны раньше 2026 года. Их числа полезны как история: они описывают прошлое поколение моделей.

PingPong ведёт Илья Гусев. Модель-«интервьюер» изображает пользователя в ролевых диалогах с набором персонажей, проверяемая модель отвечает, а модель-судья оценивает по трём признакам: остаётся ли ответ в образе, беглость языка и развлекательность. Отдельная колонка беглости языка прямо относится к качеству русского. Данные на 25 мая 2025 года, 82 модели, шкала от 1 до 5. Верх: deepseek_v3_0324 — 4,79 ±0,04 при беглости 4,96; claude_3_5_sonnet_20241022 — 4,78 при беглости 4,94; gpt_45_preview — 4,75 при беглости 4,99. Российские строки того же снимка: saiga_yandexgpt_8b — 4,59 при беглости 4,98, t_pro_it_1_0 — 4,46 при беглости 4,94, gigachat_max_preview — 4,23 при беглости 4,90, yandexgpt_4_pro — 4,11 при беглости 4,92.

Колонка беглости в этом зачёте отдельно показательна: у российских строк она держится на уровне 4,90–4,98, то есть совпадает с верхом таблицы, а расходятся строки в основном по двум другим признакам.

ru_llm_arena от VikhrModels — переработка набора Arena-Hard-Auto под русский язык: 500 запросов по 50 темам, модель-судья GPT-4-1106-preview сравнивает ответы с базовой моделью gpt-3.5-turbo-0125, каждое сравнение делается дважды с перестановкой ответов. Состояние арены — на 27 октября 2024 года. Верх: gpt-4-1106-preview — 90,9, gpt-4o-mini — 83,9, T-Tech-T-pro-it-1.0 — 83,8, gigachat_max_26.20_uncen — 82,7, vikhr-nemo-12b-instruct-r-21-09-24 — 79,8, T-Tech-T-lite-it-1.0 — 71,0, yandex_gpt_pro_v4_26102024 — 50,5. Авторы прямо приводят в описании оговорку: по сообщениям Ильи Гусева, одна из моделей при дообучении содержала часть ответов из набора, что могло завысить её результат.

MMLU-ProX, срез по русскому — 11 829 одинаковых вопросов на 29 языках по 10 вариантов ответа. На сайте проекта стоит пометка «Leaderboard (Coming Soon)», а числа опубликованы в статье EMNLP ноября 2025 года, откуда они и взяты. Русская колонка: Qwen3-235B-Think — 77,0, DeepSeek-R1 — 76,4, DeepSeek-V3 — 74,9, Qwen3-235B — 72,9, GPT-4.1 — 71,2, Qwen3-32B-Think — 69,1, Qwen3-32B — 68,0, Phi4-14B — 65,2, Gemma3-27B — 62,5. Английская колонка тех же моделей: 80,7, 79,5, 79,6, 73,5, 79,8, 74,9, 71,8, 71,5, 66,5. У Qwen3-235B-Think разница между русской и английской колонкой — 3,7 пункта, у DeepSeek-R1 — 3,1; у GPT-4o она обратная: 62,0 по-русски против 59,9 по-английски.

Small Shlepa от VikhrModels — русские вопросы с выбором ответа по праву, кино, книгам и музыке. Последний коммит в репозиторий — 8 августа 2024 года, состав таблицы — открытые модели того времени.

RussianSuperGLUE — 9 задач на понимание русского языка, тот проект, продолжением которого MERA называет себя на своём сайте. В таблице 44 строки, первая — HUMAN BENCHMARK с 0,811, вторая — ruadapt Solar 10.7 twostage от RCC MSU с 0,805, третья — Mistral 7B LoRA от Saiga team с 0,763. Состав участников — дообученные модели-энкодеры прошлого поколения: не чат-модели, а сети, которые настраивали под каждую задачу отдельно.

INCLUDE — 197 243 пары «вопрос — ответ» из локальных экзаменационных источников на 44 языках, статья ноября 2024 года. Русский представлен 10 169 вопросами. По языкам опубликован один замер, GPT-4o: русский — 75,00 %, гуманитарные дисциплины — 77,5, STEM — 83,4, прикладные — 70,8, лицензии — 63,9.

Global-MMLU — MMLU с переводом, выверенным носителями, 42 языка, русский входит в число одиннадцати языков с проверенным человеком переводом. Статья декабря 2024 года; результаты в ней опубликованы по группам языков, а не таблицей «модель на язык».

Общее правило по всем семи: числа из них отвечают на вопрос о моделях своего времени. Свежую картину дают Arena с фильтром Russian и MERA Reason, а таблицы MERA и llmarena.ru стоят на апрельских датах — 11 и 18 апреля 2026 года соответственно.

Что стоит за местом в зачёте: чем модель берёт на русском

Место в таблице складывается из разных вещей у разных зачётов, и на этом строится выбор под работу.

Слепое голосование сравнивает то, что человек получил в ответ на свой живой запрос. Оно чувствительно к оформлению, длине и тону ответа, поэтому у Arena по умолчанию включена поправка на оформление — источник вычитает из рейтинга то, что ответ просто аккуратнее разложен по пунктам, — а у llmarena.ru она стоит переключателем. Это зачёт про повседневную переписку: как модель отвечает на то, с чем к ней приходят.

Закрытый набор заданий сравнивает долю правильных ответов. У MERA это 15 основных задач: школьный экзамен, вопросы с выбором ответа, логика, арифметика, код, работа с этикой. Счёт ведётся по совпадению с эталоном: ответ либо совпал, либо нет. Это зачёт про знания и точность.

Набор на рассуждение сравнивает способность довести вывод до конца. У MERA Reason это олимпиадные задачи, где ответ проверяется на математическую равнозначность эталону, и длинный текст, где надо собрать ответ из разбросанных по нему кусков. Разница между двумя вариантами одной модели видна там прямо в таблице: строки с пометкой Thinking стоят выше строк с пометкой Instruct того же семейства.

Разрезы по видам работы есть у llmarena.ru: код, математика, творческие задачи и наука, и у каждого разреза своё число голосов и своя верхняя строка.

Отсюда практическое правило чтения. Модель, стоящая высоко в слепом голосовании, отвечает так, как людям нравится читать по-русски. Модель, стоящая высоко в MERA, точнее отвечает на вопросы с проверяемым ответом. Это не одно и то же свойство, и верх у двух таблиц разный.

Разбор по работам: под какую задачу какая модель

Повседневная переписка и рабочие письма на русском. Смотреть надо на русский срез Arena: там голосуют люди, писавшие свои запросы по-русски. Верх — Claude Fable 5 с 1519, Gemini 3.7 Flash в режиме high с 1517, Muse Spark 1.2 с 1512 (снимок 27 августа 2026 года). Из моделей каталога GEN202 в первой двадцатке этого среза стоят Claude Fable 5, Claude Opus 5, GPT-5.6 Sol и Gemini 3.6 Flash.

Задачи с проверяемым ответом: расчёты, экзаменационные вопросы, разбор условий. Здесь работает MERA: Claude-Opus-4.6 с 0,862, живой человек с 0,852, GPT-5.4 с 0,821 (снимок из веб-архива 11 апреля 2026 года). Колонка ruMMLU внутри того же снимка показывает отдельно вопросы с выбором ответа: 0,925 у первой строки, 0,918 у GPT-5.4, 0,905 у Cotype Pro 2.5.

Многошаговое рассуждение и олимпиадная математика по-русски. MERA Reason: Claude Opus 4.8 с 80,82, gemma-4-31B-it с 73,94, Qwen3.5-122B-A10B с 67,36 (обновление 30 июля 2026 года). Внутри набора самый разделяющий столбец — Luzitania: 58,96 у первой строки против 43,43 у второй.

Длинный русский текст в одном запросе. Работу с длинным насыщенным текстом меряет столбец MMReD в MERA Reason: 5 типов вопросов на трёх длинах — 32, 64 и 128 тысяч токенов. Верхние строки: Qwen3.5-27B — 96,36, DeepSeek-v4-Pro — 94,94, Claude Opus 4.8 — 93,97, Qwen3.5-122B-A10B — 93,07. По каталогу GEN202 размер окна контекста — сколько текста помещается в один запрос — такой: у трёх уровней GPT-5.6 — 1 050 000 токенов и ответ до 128 000, у трёх моделей Claude — 1 000 000 и ответ до 128 000, у Gemini 3.6 Flash — 1 000 000 и ответ до 64 000, у Grok 4.5 — 500 000 токенов. Как считается счёт за длинный запрос, разобрано отдельно: что такое миллион токенов.

Код с русскими комментариями и постановкой задачи на русском. Разрез «код» у llmarena.ru: Gemini 3 Pro Preview — 1240, GPT-5.4 — 1222, Gemini Pro 2.5 Preview 03-25 — 1188, всего 31 822 голоса (снимок 18 апреля 2026 года). Свежие зачёты по коду собраны на отдельной странице: лучшая нейросеть для написания кода.

Творческий текст на русском: истории, сценарии, посты. Разрез «творческие задачи» у llmarena.ru: GPT-5.4 — 1219, Gemini 3 Pro Preview — 1181, Gemini 3.1 Pro Preview — 1164, 26 132 голоса. Ролевые диалоги и беглость языка мерил PingPong: deepseek_v3_0324 — 4,79 при беглости 4,96, gpt_45_preview — 4,75 при беглости 4,99 (25 мая 2025 года, история вопроса).

Тексты на потоке. Порядок работы, ставки и разбор моделей под письменную работу собраны на странице нейросеть для написания текстов, а рабочий чат для этого — нейросеть для текста.

Лучшая бесплатная нейросеть на русском: модели с открытой лицензией

Лицензию два зачёта печатают прямо рядом с названием модели — llmarena.ru и Arena, — и по этой колонке список собирается из таблиц выше.

Из русской арены llmarena.ru, снимок 18 апреля 2026 года:

Ранг (UB) Модель Организация Elo Голосов
4 DeepSeek V3.2 DeepSeek 1133 797
9 DeepSeek V3 0324 DeepSeek 1091 1 455
9 DeepSeek R1 DeepSeek 1086 789
9 Xiaomi MiMo-V2-Flash Xiaomi 1083 669
11 Qwen3 235B A22B Qwen 1076 658
16 MiniMax M2.1 MiniMaxAI 1063 909
27 t-tech/T-pro-it-2.0 Т-Банк 1036 981
47 RuadaptQwen2.5-32B-Pro-Beta RefalMachine 986 749
51 Vikhr-Nemo-12B-Instruct-R-21-09-24 Vikhrmodels 970 859
63 t-tech/T-lite-it-1.0 Т-Банк 942 595
91 MTSAIR/Cotype-Nano МТС 854 1 009

Верхняя строка списка — DeepSeek V3.2 с 1133 очками и рангом 4. Из российских открытых моделей выше всех T-pro-it-2.0 от Т-Банка с 1036 очками; в апрельском снимке MERA у неё общий балл 0,66 при ruMMLU 0,79.

Из Arena, где лицензия тоже стоит колонкой: kimi-k3-max от Moonshot идёт под собственной лицензией Kimi K3 и занимает восемнадцатое место русского среза — 1488 ±14 при 1 783 голосах (снимок 27 августа 2026 года). GLM-5.3 max от Z.ai стоит под лицензией MIT и занимает в русском срезе тридцать пятое место с 1471 ±23 при 688 голосах, а в общем зачёте того же дня — пятнадцатое с 1484 ±8 при 5 820 голосах.

Открытая лицензия означает, что модель разрешено скачать и запустить на своём оборудовании. Второй путь попробовать модель на своём русском тексте — чат на этой странице: первая работа идёт за счёт сервиса. После входа новому счёту начисляется 50 кредитов (25 ₽), и этого хватает, чтобы прогнать одно и то же задание через несколько моделей и сравнить ответы.

Сколько стоит русский текст

Русский текст пишут те же восемь текстовых моделей каталога, что и любой другой, и счёт у них идёт за токены: отдельно за то, что вы отправили, отдельно за то, что модель написала в ответ. Ставка GEN202 ниже официальной цены разработчика на десять процентов, оплата рублями, ключ один на весь каталог.

Модель Официально, $ за млн вход / выход GEN202, вход GEN202, выход Контекст, токенов
GPT-5.6 Luna 0,2 / 1,2 18 ₽ 108 ₽ 1 050 000
GPT-5.6 Terra 2 / 12 180 ₽ 1080 ₽ 1 050 000
GPT-5.6 Sol 5 / 30 450 ₽ 2700 ₽ 1 050 000
Gemini 3.6 Flash 1,5 / 7,5 135 ₽ 675 ₽ 1 000 000
Grok 4.5 2 / 6 180 ₽ 540 ₽ 500 000
Claude Opus 5 5 / 25 450 ₽ 2250 ₽ 1 000 000
Claude Sonnet 5 2 / 10 180 ₽ 900 ₽ 1 000 000
Claude Fable 5 10 / 50 900 ₽ 4500 ₽ 1 000 000

Цены в рублях — за миллион токенов; они подставляются из каталога и меняются вместе с ним. Полный список моделей со ставками — в каталоге, примеры вызова текстовых моделей — на странице API языковых моделей, сравнение с официальными ставками — на странице цен.

Первая строка русского зачёта и самая дешёвая строка каталога — разные модели, и таблицы выше показывают это прямо. Claude Fable 5 стоит первым в русском срезе Arena при официальной цене 10 и 50 долларов за миллион токенов. Gemini 3.6 Flash стоит девятнадцатым в том же срезе при официальной цене 1,5 и 7,5 доллара за миллион токенов. Расстояние между ними в таблице — 32 очка при интервалах ±12 и ±13.

Вторая ступень цены срабатывает на длинном запросе, и по каталогу она устроена так: у трёх уровней GPT-5.6 порог стоит на 272 000 входных токенов и включается строго выше него — официальная цена Luna меняется с 0,2 и 1,2 доллара на 0,4 и 1,8, у Terra с 2 и 12 на 4 и 18, у Sol с 5 и 30 на 10 и 45. Grok 4.5 доходит до второй ступени на 200 000 токенов и считает по ней уже с самого порога: длинный русский текст такого объёма идёт по 4 и 12 долларов вместо 2 и 6. У Gemini 3.6 Flash и у трёх моделей Claude ставка одна на любой длине запроса.

Про рублёвую оплату и способы платежа за зарубежные модели отдельно написано на странице оплата нейросетей, а про доступ к ним из России — на странице нейросети в России.

Что брать под работу: сводная таблица

Работа Что показывают зачёты Источник и дата снимка
Повседневная переписка и письма по-русски Claude Fable 5 — 1519, Gemini 3.7 Flash (high) — 1517, Muse Spark 1.2 — 1512 Arena, срез Russian, 27 августа 2026
Рассуждение и олимпиадная математика на русском Claude Opus 4.8 — 80,82, gemma-4-31B-it — 73,94, Qwen3.5-122B-A10B — 67,36 MERA Reason, 30 июля 2026
Экзаменационные задания, знания, точность Claude-Opus-4.6 — 0,862, живой человек — 0,852, GPT-5.4 — 0,821 MERA, снимок из веб-архива 11 апреля 2026
Вопросы с выбором ответа на русском Claude-Opus-4.6 — 0,925, GPT-5.4 — 0,918, Cotype Pro 2.5 — 0,905 ruMMLU внутри MERA, 11 апреля 2026
Российские и зарубежные модели одной меркой Gemini 3 Pro Preview — 1210, Alice AI LLM — 1083, T-pro-it-2.0 — 1036, GigaChat 2 Max — 999 llmarena.ru, 18 апреля 2026
Длинный русский текст в одном запросе Qwen3.5-27B — 96,36, DeepSeek-v4-Pro — 94,94, Claude Opus 4.8 — 93,97 MMReD внутри MERA Reason, 30 июля 2026
Постановка задачи по коду на русском Gemini 3 Pro Preview — 1240, GPT-5.4 — 1222 разрез «код» llmarena.ru, 18 апреля 2026
Творческий текст на русском GPT-5.4 — 1219, Gemini 3 Pro Preview — 1181 разрез «творческие задачи» llmarena.ru, 18 апреля 2026
Беглость русской речи в диалоге gpt_45_preview — 4,99, gemma3_27b_it — 4,99, deepseek_v3_0324 — 4,96 PingPong, 25 мая 2025 — история вопроса
Дешёвый вход на длинном русском тексте GPT-5.6 Luna — 18 ₽ за миллион входных токенов Каталог GEN202

Читать таблицу стоит по строкам. У одного человека выходит два-три разных ответа под разные работы, и это нормальный итог: верх у разных зачётов разный, потому что задания в них разные.

Общий разбор всех задач сразу — тексты, картинки, видео, код — собран в статье про лучшую нейросеть под задачу. Сравнение агрегаторов доступа между собой — на странице агрегатор нейросетей.

Доступ к моделям за рубли, одним ключом

Модели из таблиц выше открываются в GEN202 одним ключом и одним рублёвым счётом: семейство Claude, GPT, Gemini, Grok и остальной каталог. Регистрация российская, счёт рублёвый, ставка на десять процентов ниже официальной цены разработчика, и при первом входе на счёт начисляется 50 кредитов (25 ₽).

Русский текст здесь идёт по тем же ставкам, что и любой другой: счёт считается за токены, а не за язык. Самый дешёвый вход в каталоге — 18 ₽ за миллион входных токенов.

Работать с моделями можно двумя способами. Чат открывается в браузере, переписка сохраняется, а имя модели выбирается в списке над строкой ввода — это путь для человека, который пишет и читает сам. Ключ подставляется в приложение, скрипт или сценарий автоматизации — это путь для работы на потоке: бот, обработка заявок, подготовка текстов пачками. Сколько запросов помещается в один разговор и как считаются ограничения, разобрано на странице лимиты нейросетей.

FAQ

Какая самая лучшая русская нейросеть? Среди моделей, сделанных в России, выше всех в единственной таблице, где российские и зарубежные модели померены одинаково, стоит Alice AI LLM от Яндекса — 1083 очка и ранг 11 (llmarena.ru, пересчёт 18 апреля 2026 года). В апрельском снимке MERA верхняя российская строка — BerryLM-v2-reasoning-budget-low от Wildberries и Russ с общим баллом 0,81, следом Cotype Light 3 от MWS AI с 0,792 и GigaChat-3.1-Ultra с 0,712; замеры этих строк присланы самими разработчиками. Среди моделей, отвечающих по-русски вообще, первую строку русского среза Arena занимает Claude Fable 5 с 1519 очками (снимок 27 августа 2026 года).

Лучшая нейросеть онлайн на русском — какая? По слепым голосам живых людей, писавших запросы по-русски, верх таблицы такой: Claude Fable 5 — 1519 ±12, Gemini 3.7 Flash в режиме high — 1517 ±24, Muse Spark 1.2 в режиме xHigh — 1512 ±32 (Arena, срез Russian, 27 августа 2026 года, 804 885 голосов по русскому, 359 моделей). Колонку «Разброс места» источник печатает рядом: у первой строки это 1–10, то есть верхняя десятка здесь читается как группа, а не как порядок.

Какие есть лучшие нейросети на русском онлайн бесплатно? Лицензию печатают колонкой два зачёта. В llmarena.ru открытая лицензия стоит у DeepSeek V3.2 с 1133 очками и рангом 4, у DeepSeek V3 0324 с 1091, у Qwen3 235B A22B с 1076, у t-tech/T-pro-it-2.0 с 1036 и у Vikhr-Nemo-12B с 970 (снимок 18 апреля 2026 года). В Arena под лицензией MIT идёт GLM-5.3 max — тридцать пятое место русского среза с 1471 ±23, а kimi-k3-max под собственной лицензией Kimi K3 занимает там восемнадцатое место с 1488 ±14 (снимок 27 августа 2026 года). Открытую модель можно скачать и запустить на своём оборудовании. Попробовать закрытые модели на своём русском тексте можно в чате на этой странице: первая работа идёт за счёт сервиса.

Лучшая бесплатная нейросеть на русском — с чего начать проверку? Возьмите своё рабочее задание на русском, а не придуманное: короткий общий вопрос модели проходят почти одинаково, а расходятся они на длинном тексте, на нескольких условиях сразу и на задачах, где надо довести вывод до конца. Это видно прямо в таблицах: в MERA Reason столбец Luzitania с многошаговым рассуждением разводит первую и вторую строки больше чем на пятнадцать пунктов, тогда как на задачах AIME разница между ними — три с половиной пункта.

Чем русские нейросети отличаются от зарубежных по замерам? Единственная таблица, где те и другие померены одинаково, — llmarena.ru от 18 апреля 2026 года. В ней верх занимают Gemini 3 Pro Preview с 1210, Gemini Pro 2.5 Preview с 1196 и GPT-5.4 с 1187, а верхняя российская строка — Alice AI LLM с 1083. В разрезе по математике той же таблицы Alice AI LLM стоит пятой с 1135 очками. В апрельском снимке MERA российские модели занимают четвёртую, шестую, седьмую строки и дальше: BerryLM-v2 с 0,81, Cotype Light 3 с 0,792, BerryLM-L с 0,775.

Какая нейросеть лучше всех понимает русский язык на экзаменационных вопросах? По разрезу ruMMLU внутри MERA — 14 012 вопросов с выбором ответа на русском — верх такой: Claude-Opus-4.6 с 0,925, GPT-5.4 с 0,918, Cotype Pro 2.5 с 0,905, предварительная версия Cotype с 0,903, Claude Opus 4.5 с 0,901 (снимок из веб-архива 11 апреля 2026 года). Замер живого человека на всём наборе MERA равен 0,852 при ruMMLU 0,844.

Почему в разных рейтингах русских нейросетей разные победители? Потому что зачёты меряют разную работу и собраны на разных участниках. Arena считает голоса людей на живых русских запросах, MERA — долю правильных ответов на закрытом наборе из 23 заданий, MERA Reason — доведение вывода до конца на олимпиадных задачах, llmarena.ru — снова голоса, но со своим составом моделей. Составы участников у этих таблиц почти не пересекаются, поэтому места из одной в другую не переносятся. Плюс даты: свежие числа — 27 августа и 30 июля 2026 года, а таблицы MERA и llmarena.ru стоят на 11 и 18 апреля 2026 года.

Что у Artificial Analysis есть по русскому языку? Сводный индекс Artificial Analysis собран на англоязычных заданиях — это написано на странице методики источника. Многоязычность там меряется отдельным набором на основе Global-MMLU-Lite, примерно 400 вопросов на язык, и в его список входят английский, китайский, хинди, испанский, французский, арабский, бенгальский, португальский, индонезийский, японский, суахили, немецкий, корейский, итальянский, йоруба и бирманский. Русский меряют Arena с фильтром Russian, MERA, MERA Reason и llmarena.ru — четыре зачёта, разобранные выше.

Можно ли сравнить несколько моделей на одном русском тексте? Да, и это самый прямой способ выбрать. GEN202 даёт один ключ ко всему каталогу и общий счёт в рублях: одно и то же задание уходит в Claude Fable 5, в GPT-5.6 Sol и в Gemini 3.6 Flash, а дальше вы сравниваете, что вернулось. В чате ключ для этого не нужен — модель выбирается в списке над полем ввода.

Чат с нейросетью онлайн

Claude, ChatGPT, Gemini, Grok и другие нейросети открываются в одном окне браузера, отдельная установка для этого не нужна. Выберите нужную в списке над полем ввода и напишите задание по-русски: первый ответ бесплатно и без регистрации. Больше моделей и история разговоров — в чате с нейросетью.