ИИ-топы: рейтинги искусственного интеллекта¶
ИИ-топ — это рейтинг или классификация искусственного интеллекта, в которой модели, системы, компании или страны упорядочиваются по определённым показателям: производительности на бенчмарках, масштабу параметров, уровню финансирования или коммерческому внедрению. Подобные топы публикуются исследовательскими лабораториями, аналитическими агентствами и профильными изданиями и служат ориентиром для оценки состояния отрасли.
¶Основные типы рейтингов ИИ
Рейтинги искусственного интеллекта можно разделить на несколько категорий в зависимости от того, что именно оценивается.
¶Бенчмарки моделей
Наиболее распространённый тип — сравнение языковых и мультимодальных моделей по результатам стандартных тестов. К числу таких тестов относятся MMLU (многозадачное понимание языка), HumanEval (генерация кода), GPQA (научные вопросы уровня аспирантуры), ARC-AGI и GSM8K (математические задачи). Лидерами подобных рейтингов в 2023–2025 годах последовательно становились модели GPT-4 и GPT-4o (OpenAI), Claude 3.5 и Claude 3.7 Sonnet (Anthropic), Gemini 1.5 и Gemini 2.0 (Google DeepMind), а также китайские модели DeepSeek-V3 и Qwen от Alibaba.
¶Рейтинги стран и экосистем
Отдельный класс топов оценивает национальные ИИ-экосистемы. Индекс ИИ Стэнфордского университета (Stanford AI Index) ежегодно публикует данные о количестве публикаций, инвестициях, численности специалистов и уровне регулирования в разных странах. По этим данным, лидируют США, Китай и Великобритания; Россия входит в число стран с заметным научным вкладом, но с ограниченным объёмом частных инвестиций в сектор.
¶Топы моделей по размеру
Рейтинги по числу параметров моделей (например, на ресурсе Hugging Face) отражают масштаб вычислительных ресурсов, вкладываемых в обучение. Среди крупнейших публично известных моделей — Llama 3.1 405B (Meta), Nemotron (NVIDIA) и ряд моделей Alibaba и Tencent.
¶Методика составления топов
Практически все публичные рейтинги опираются на бенчмарки — стандартизированные наборы задач с измеримым результатом. Основные слабые стороны такой методики:
- Переобучение на тестах. Модель может давать высокие показатели на конкретном наборе вопросов, не обладая общей способностью к рассуждению.
- Неполное покрытие задач. Большинство бенчмарков проверяют знание английского языка и западной образовательной традиции, что искажает сравнение моделей, обученных на других языках.
- Стоимость тестирования. Некоторые закрытые бенчмарки (например, LMSYS Chatbot Arena, основанный на попарных сравнениях ответов людьми) требуют значительных ресурсов.
Для борьбы с этими проблемами исследователи используют слепые тесты, скрытые наборы вопросов и оценку «вслепую» людьми-экспертами.
¶Российский контекст
В России публикуются собственные рейтинги и обзоры отрасли. К числу известных отечественных языковых моделей относятся YandexGPT (Яндекс), GigaChat (Сбер), «Алиса» (Яндекс) и ряд моделей от МФТИ, ИТМО и других вузов. Государственная программа «Развитие искусственного интеллекта в Российской Федерации до 2030 года» ставит задачу выведения российских систем в мировую пятёрку по объёму рынка ИИ; по состоянию на 2024 год российские модели входят в мировые топы по отдельным локализованным задачам, но уступают лидерам по общим бенчмаркам.
¶Значение топов для отрасли
Рейтинги ИИ выполняют несколько функций:
- Ориентир для исследователей — показывают, какие архитектуры и методы обучения дают наилучшие результаты.
- Маркетинговый инструмент — компании активно используют высокие места в топах при презентации продуктов и привлечении инвестиций.
- Основа для регулирования — законодатели опираются на классификации уровня риска моделей (например, Европейский акт об ИИ, вступивший в силу в 2024 году).
- Практический выбор — разработчики и бизнес-пользователи ориентируются на топы при выборе модели для конкретной задачи.
¶Критика рейтингов
Основная претензия к публичным топам ИИ — их коммерческая ангажированность: часть бенчмарков финансируется самими компаниями-разработчиками моделей, что создаёт конфликт интересов. Дополнительно критики отмечают, что гонка за лидерством в бенчмарках стимулирует модели, «заточенные» под тесты, а не под реальные пользовательские сценарии. В ответ на это сообщество переходит к оценке моделей по реальным сценариям использования и независимым слепым тестам.
Источники:
- Stanford HAI, AI Index Report
- LMSYS Chatbot Arena Leaderboard
- Hugging Face Open LLM Leaderboard
- Европейский акт об искусственном интеллекте (AI Act)
- Программа «Развитие искусственного интеллекта в Российской Федерации до 2030 года»