Вместо привычных синтетических тестов семь независимых команд выставили свои флагманы на восемь прикладных задач. Исходный код скрыли, а шесть экспертов оценивали обезличенный результат только по логам и скриншотам.

Судьи давали до 30 баллов за каждый раунд без права голосовать за свою разработку. Итоговая тройка выглядит так:
- Fable 5.1 взяла золото со 145 баллами;
- Kimi K3 забрала серебро со 133 баллами;
- GPT-5.6 Sol замкнула тройку со 118 баллами.
В визуальных задачах вперёд вырвалась Kimi K3: 24 балла за сборку 3D-робота и 22 балла за сложную инфографику.
Загадку на логику о спасшихся осилила только Gemini 3.8 Flash: нашла ключ за 19 вопросов. DeepSeek слил 313 тысяч токенов впустую, а Qwen сдалась на восьмом шаге.
В турнире муравьиных алгоритмов из 3360 партий Fable разгромила конкурентов с 77,5 балла из 100. Она единственная догадалась грабить чужие муравейники.
Экономнее всех сработала GPT-5.6 Sol: весь пул задач обошёлся ей в $0,35 против $7,09 у прожорливой Kimi.
Идеального ИИ на все случаи нет: под строгую логику, графику и фиксированный бюджет практичнее комбинировать разные решения.
Что это значит
Перед запуском проекта в прод стоит просчитать расходы на API: цена за одинаковый результат у разных сеток различается в разы.