OpenAI раскрыла характеристики своего первого ИИ-ускорителя Jalapeño. Чип разработан вместе с Broadcom и предназначен для инференса — работы уже обученных нейросетей. Первые поставки начнутся позднее в 2026 году, массовое производство — в 2027-м.
Компания собирается устанавливать по 128 ускорителей в одну стойку. Такая система получит 1,7 экзафлопса вычислительной мощности в 4-битном формате, 27,5 ТБ памяти HBM4 и почти 2 петабайта в секунду пропускной способности памяти.
Каждый Jalapeño выдаёт 13,4 петафлопса при вычислениях MXFP4. На один ускоритель приходится 216 ГБ HBM4 с пропускной способностью 15,4 ТБ/с.
Высокая скорость памяти особенно важна при генерации текста. На этом этапе ускоритель постоянно загружает параметры модели и её текущее состояние. OpenAI спроектировала Jalapeño так, чтобы реже перемещать данные и хранить KV-кеш — память о предыдущих токенах — ближе к вычислительным блокам.
По данным OpenAI, системы с Jalapeño выполняют в 1,5–1,9 раза больше работы на пиковой нагрузке, чем выбранные для сравнения решения. Задержка оказалась ниже в 1,7–3,6 раза, а в сценариях с минимальным временем ответа ускорение достигло 2,1–4,1 раза. Тесты проводились на моделях GPT-OSS-120B, DeepSeek R1 и Kimi K2.5 из набора InferenceX.
Эти результаты пока нельзя считать независимым сравнением. OpenAI сопоставляла новый чип со стойками Nvidia GB200 и GB300, выпущенными в 2024 и 2025 годах. В тестах также не использовали спекулятивное декодирование — программный метод ускорения генерации.
Jalapeño не заменит ускорители Nvidia и AMD при обучении моделей. Универсальные GPU остаются гибче, а собственный чип OpenAI заточен под одну задачу — инференс. При его проектировании компания применяла ИИ и за девять месяцев завершила разработку дизайна, подготовив его к передаче на фабрику для производства.