Откуда берутся очки
Рейтинг строится на голосах из режима Battle: пользователь не знает, какие модели ему отвечают, и выбирает лучший ответ. Из миллионов таких парных сравнений арена считает очки по модели Брэдли — Терри — это родственник шахматного рейтинга Эло.
Смысл очков — вероятность победы. Если у одной модели на 100 очков больше, чем у другой, в слепом сравнении её ответ предпочтут заметно чаще. Разница в 5–10 очков почти ничего не значит.
Как читать таблицу
- Score — очки модели. Чем выше, тем чаще люди выбирают её ответы.
- ± после очков — доверительный интервал. У новой модели он широкий, потому что голосов мало.
- Votes — число голосов. Модель с 2 тыс. голосов оценена менее надёжно, чем модель с 80 тыс.
- Rank — место с учётом погрешности. Несколько моделей могут делить одно место, если их интервалы пересекаются.
Кто в топе в сентябре 2026
В текстовом рейтинге на 25 сентября 2026 года первое место заняла Claude Opus 5.5 в режиме high — 1509 очков, но у неё пока немного голосов и погрешность ±12. Сразу за ней Claude Opus 4.6, Fable 5 и Opus 4.7 — разница между ними в пределах нескольких очков. В десятке также Muse Spark от Meta и Gemini 3.8 Flash от Google.
Рейтинг меняется каждую неделю: выходят новые модели, накапливаются голоса. Поэтому смотрите актуальную таблицу на arena.ai перед выбором, а не прошлогодние скриншоты.
Какие есть категории
Кроме общего и текстового рейтинга, на сайте есть отдельные таблицы: WebDev и Image-to-WebDev для кода интерфейсов, Text to Image и Image Edit для картинок, Text to Video, Image to Video и Video Edit для видео, а также Vision, Document, Search и Agent. Лидеры в разных категориях часто разные: лучшая модель для текста не обязательно лучшая для картинок.
Чего рейтинг не скажет
Это вкус большинства
Люди голосуют за понятный и приятный ответ, а не обязательно за самый точный.
Вопросы в основном на английском
На русском расклад может отличаться — проверяйте на своих задачах.
Цена не учитывается
Модель на 5 очков выше может стоить в несколько раз дороже.
Режимы модели разные
«high», «max», «thinking» в названии — это одна модель с разным уровнем рассуждения и разной ценой.
Как использовать рейтинг на практике
Смотрите на категорию, которая ближе к вашей задаче: для кода — WebDev, для работы с PDF — Document, для картинок — Text to Image и Image Edit. Общий текстовый рейтинг хорош как стартовая точка, но не как окончательный ответ.
Отберите три-четыре модели из верхней части нужной таблицы, включая одну недорогую. Затем проверьте их на своих примерах — десяти реальных задач обычно хватает, чтобы увидеть разницу. Если разница незаметна, выбирайте ту, что дешевле и быстрее.
И возвращайтесь к рейтингу раз в месяц-два: лидеры меняются быстро, а у новинок в первые недели мало голосов и широкая погрешность.
Когда быстрее через ИИ-агента
Рейтинг помогает выбрать модель, но саму работу за вас не делает. В ИИ-агенте LeanTech многие лидеры арены доступны в одном окне: Claude Opus 5.5 и Fable 5.1, GPT-6, Gemini 3.1 Pro, Grok 4.7, Muse Spark, для картинок — Nano Banana Pro, GPT Image 2 и FLUX 2. Можно выбрать модель вручную или доверить выбор агенту, а результат получить файлом.
Агент не повторяет рейтинг и не устраивает слепое сравнение, не работает внутри arena.ai и не ставит программы. Картинки доступны с тарифа Light, видео — только на Pro и Power.