LMArena (arena.ai): как читать рейтинг и подобрать модель под задачу
Опубликовано: 2026-10-02 · Автор: AI Release · @ai_release1
⚡ Главное за 5 секунд - LMArena, сейчас Arena.ai, — сервис сравнения ИИ-моделей по голосам пользователей: в Battle Mode две анонимные модели получают один запрос, вы выбираете лучший ответ, и только после голосования раскрываются их названия. - Рейтинги разбиты по типам задач — Text, Code, Image, Video, Text-to-Image, а внутри есть категории вроде Creative Writing или Coding и блок Occupational по профессиональным сценариям. - Ограничение: общий Rank мало что говорит о вашей задаче, а Arena Score — это показатель пользовательских предпочтений, а не доля правильных ответов. ### 🔍 Что обнаружено На странице Leaderboard сначала выбирается раздел под нужный тип задачи: Text Arena отвечает за текст, Code — за программирование, Image — за изображения, Video — за видео. Внутри Text Arena есть свои категории: Creative Writing показывает результаты на задачах с текстом, Instruction Following — насколько модели следуют подробным инструкциям, Coding — как справляются с кодом, Multi-Turn — как ведут длинный диалог. Если нужной категории нет, её ищут через «+ View more». Отдельно есть блок Occupational, группирующий модели по профессиональным сценариям: IT, тексты и языки, бизнес, математика, право, медицина и другие области. В таблице смотрят на четыре показателя: Score, Rank, Rank Spread и Votes. Rank — текущее место, оно зависит от раздела, категории и включённых настроек, поэтому одна модель может быть первой в одном сценарии и заметно ниже в другом. Rank Spread — диапазон мест с учётом статистической неопределённости: Rank 10 при Rank Spread 4–18 означает, что позиция может лежать примерно между четвёртым и восемнадцатым местом. Ниже рейтинга есть настройки: Style Control уменьшает влияние предпочтений к стилю ответа, Factuality сильнее учитывает фактическую точность, список моделей можно ограничить по лицензии — все, только проприетарные или только open source, а также задать диапазон Score, цену входных и выходных токенов и длину контекстного окна. Режим Pareto показывает соотношение качества и стоимости: выше — с большим Arena Score, левее — более дорогие, правее — более дешёвые, зелёная линия выделяет лучший баланс. ### 💡 Почему это важно Практический сценарий такой: составить шорт-лист из 2–3 моделей в Leaderboard, а затем проверить их на своих запросах. Side-by-Side позволяет заранее выбрать две конкретные модели и сравнить их на одинаковом запросе, Direct — поработать с одной. При финальном выборе учитывают цену, контекстное окно, доступность API, скорость и нужные функции: высокий Score не поможет, если модель слишком дорогая или не вмещает нужный объём текста при обработке больших документов через API. ### 🧩 Контекст Материал — туториал в блоге компании BotHub на Хабре, опубликован 2 октября, уровень «Простой», время чтения 10 минут. Автор напоминает: после сравнения моделей в LMArena следующий шаг — протестировать подходящий вариант на реальной задаче, и для этого необязательно оформлять отдельные подписки на разные сервисы.
⚡ Главное за 5 секунд - LMArena, сейчас Arena.ai, — сервис сравнения ИИ-моделей по голосам пользователей: в Battle Mode две анонимные модели получают один запрос, вы выбираете лучший ответ, и только после голосования раскрываются их названия.
- Рейтинги разбиты по типам задач — Text, Code, Image, Video, Text-to-Image, а внутри есть категории вроде Creative Writing или Coding и блок Occupational по профессиональным сценариям.
- Ограничение: общий Rank мало что говорит о вашей задаче, а Arena Score — это показатель пользовательских предпочтений, а не доля правильных ответов.
🔍 Что обнаружено На странице Leaderboard сначала выбирается раздел под нужный тип задачи: Text Arena отвечает за текст, Code — за программирование, Image — за изображения, Video — за видео.
Внутри Text Arena есть свои категории: Creative Writing показывает результаты на задачах с текстом, Instruction Following — насколько модели следуют подробным инструкциям, Coding — как справляются с кодом, Multi-Turn — как ведут длинный диалог.
Если нужной категории нет, её ищут через «+ View more».
Отдельно есть блок Occupational, группирующий модели по профессиональным сценариям: IT, тексты и языки, бизнес, математика, право, медицина и другие области.
В таблице смотрят на четыре показателя: Score, Rank, Rank Spread и Votes.