Вместо привычных синтетических тестов семь независимых команд выставили свои флагманы на восемь прикладных задач. Исходный код скрыли, а шесть экспертов оценивали обезличенный результат только по логам и скриншотам.

Источник фото: itglobal.com
Источник фото: itglobal.com

Судьи давали до 30 баллов за каждый раунд без права голосовать за свою разработку. Итоговая тройка выглядит так:

  • Fable 5.1 взяла золото со 145 баллами;
  • Kimi K3 забрала серебро со 133 баллами;
  • GPT-5.6 Sol замкнула тройку со 118 баллами.

В визуальных задачах вперёд вырвалась Kimi K3: 24 балла за сборку 3D-робота и 22 балла за сложную инфографику.

Загадку на логику о спасшихся осилила только Gemini 3.8 Flash: нашла ключ за 19 вопросов. DeepSeek слил 313 тысяч токенов впустую, а Qwen сдалась на восьмом шаге.

В турнире муравьиных алгоритмов из 3360 партий Fable разгромила конкурентов с 77,5 балла из 100. Она единственная догадалась грабить чужие муравейники.

Экономнее всех сработала GPT-5.6 Sol: весь пул задач обошёлся ей в $0,35 против $7,09 у прожорливой Kimi.

Идеального ИИ на все случаи нет: под строгую логику, графику и фиксированный бюджет практичнее комбинировать разные решения.

Что это значит

Перед запуском проекта в прод стоит просчитать расходы на API: цена за одинаковый результат у разных сеток различается в разы.