На проектирование и запуск чипа ушло девять месяцев: архитектуру и код оптимизировали сами нейросети.

OpenAI планирует начать масштабное внедрение новинки в свои серверы уже к концу года.

Источник фото: habr.com
Источник фото: habr.com

Ускоритель Jalapeño создавали под инференс, то есть быстрый запуск уже обученных моделей.

Как сообщили в компании, разработка стартовала в феврале 2025 года, а готовый кремний тестировали уже в мае 2026-го.

По данным Tom’s Hardware, характеристики новинки задают высокую планку:

  • 216 ГБ скоростной памяти HBM4 с пропускной способностью до 15,4 ТБ/с;
  • производительность вычислений до 13,4 MXFP4 PFLOPS на чип при энергопотреблении до 550 Вт;
  • сборка в стойки до 2048 процессоров с суммарной мощностью 27 EFLOPS.

При создании чипа нейросети обошли живых специалистов.

ИИ-оптимизация улучшила параметры ключевых вычислительных блоков на 10-56% относительно наработок инженеров.

При этом сгенерированный код для моделей GPT-OSS оказался до 1,8 раза быстрее решений от людей.

Курьёз в другом: разработчики так и не смогли построчно разобрать 30 тысяч строк кернела от нейросети, хотя код отработал чисто.

Собственный чип снизит зависимость OpenAI от сторонних поставок и ощутимо собьёт себестоимость запуска тяжелых моделей.

Что это значит

– Снижение задержки в 1,7-3,6 раза на тестах InferenceX ускорит ответы в интерфейсах и API OpenAI при обработке сложных пошаговых задач.

– Быстрая оптимизация моделей под чип за пару месяцев показывает, что внедрение кастомного железа больше не будет упираться в долгую ручную адаптацию софта.