Почему общего рейтинга мало
В режиме Battle на арене люди задают самые разные вопросы — от загадок до кода — и чаще на английском. Итоговые очки отражают средний вкус, а не качество на вашей задаче. Модель из первой строки может хуже всех писать деловые письма на русском или путаться в вашей отрасли.
К тому же в рейтинге не видно цены. Для массовой задачи модель на пятом месте может оказаться в пять раз выгоднее лидера при почти том же качестве.
Метод за пять шагов
Соберите 5–10 реальных примеров
Возьмите настоящие задачи: письмо клиенту, кусок кода, выжимку договора. Без личных данных.
Сформулируйте одинаковый промпт
Каждая модель получает ровно тот же текст задачи и те же файлы.
Прогоните 2–4 модели
Например, одну из Claude, одну из GPT и одну недорогую — DeepSeek или GLM.
Оценивайте вслепую
Попросите коллегу перемешать ответы и убрать названия моделей — как на арене.
Посчитайте цену
Сравните не только качество, но и сколько стоит один ответ.
Чек-лист оценки
- Точность: нет ли выдуманных фактов, цифр и ссылок.
- Полнота: ответ закрывает задачу или его надо дописывать.
- Русский язык: нет ли кальки с английского и канцелярита.
- Формат: соблюдены ли требования — длина, структура, таблица.
- Стабильность: повторите запрос дважды — ответы не должны сильно отличаться по качеству.
Где проводить такой тест
Режим Side-by-Side на арене подходит для быстрой пробы: вы сами выбираете две модели и видите ответы рядом. Но учтите, что переписка на арене может попасть в открытые датасеты, файлы туда не приложишь так же удобно, как в рабочий чат, а результат остаётся только текстом в окне.
Для рабочих задач удобнее сервис, где модели можно переключать в одном диалоге, прикладывать документы и сразу получать результат в нужном формате.
Пример: выбираем модель для деловых писем
Допустим, отдел продаж пишет по двадцать писем клиентам в день. Берём десять настоящих писем прошлого месяца, убираем имена и суммы и формулируем задачу: «Напиши ответ клиенту на это письмо, вежливо, по делу, до 120 слов».
Прогоняем задачу через три модели — например, Claude Sonnet 5, GPT-6 Luna и DeepSeek V4. Коллега без названий оценивает ответы по чек-листу: точность, тон, длина, русский язык. Затем считаем, сколько стоит одно письмо в каждой модели.
Часто выясняется, что недорогая модель пишет письма почти так же хорошо, как флагман, и для этой задачи переплачивать не нужно. А вот для разбора сложных претензий или договоров разница между моделями становится заметной — туда стоит брать старшую.
Когда быстрее через ИИ-агента
В ИИ-агенте LeanTech сравнение можно поручить самому агенту: дать задачу, назвать модели — Claude Opus 5.5, Sonnet 5, GPT-6, Gemini 3.1 Pro, DeepSeek V4, Kimi K3, GLM 5.3 — и получить таблицу XLSX с ответами и оценками. Документы прикладываются к задаче, переписка не публикуется, оплата картой РФ, кредит равен рублю.
Честные ограничения: агент не ведёт публичный рейтинг и не заменяет слепую оценку живыми людьми — финальное решение лучше принимать вам или коллеге. Он не работает внутри других сервисов и не ставит программы. Картинки — с тарифа Light, видео — на Pro и Power.