Почти втрое быстрее NVIDIA H20: Huawei представила ИИ-ускоритель Atlas 350 для инференса. Компания Huawei Technologies, как сообщает South China Morning Post (SCMP), анонсировала ускоритель Atlas 350, ориентированный на задачи ИИ-инференса. По заявлению производителя, в подобных сценариях новинка способна обеспечивать производительность до 2,8 раза выше по сравнению с NVIDIA H20.
Известно, что Atlas 350 построен на базе чипа Ascend 950PR. Заявленная вычислительная мощность для ИИ-нагрузок в формате FP4 достигает 1,56 Пфлопс. Производительность в других режимах пока официально не раскрывается, однако ранее сообщалось примерно об 1 Пфлопс в FP8. Huawei также использует собственную память HBM. В зависимости от конфигурации ускоритель может оснащаться объёмом памяти до 128 Гбайт при пропускной способности 1,6 Тбайт/с. Остальные технические параметры пока не уточняются.
Atlas 350 специально оптимизирован для этапа предварительного заполнения (Prefill) во время инференса — наиболее ресурсоёмкой стадии работы больших языковых моделей (LLM), когда выполняется обработка пользовательского запроса. Скорость выполнения этой операции напрямую влияет на показатель TTFT (Time To First Token), то есть время от ввода запроса до появления первого токена ответа. Благодаря этому Atlas 350 подходит для ИИ-приложений реального времени и агентных платформ. Одновременно Huawei объявила о планах масштабного обновления собственного портфеля СХД, включая системы OceanStor Dorado и All-Flash решения Pacific 9926. Помимо этого, компания разрабатывает платформу FusionCube A1000, предназначенную для быстрого развёртывания ИИ-систем в сегменте малого и среднего бизнеса.
Известно, что Atlas 350 построен на базе чипа Ascend 950PR. Заявленная вычислительная мощность для ИИ-нагрузок в формате FP4 достигает 1,56 Пфлопс. Производительность в других режимах пока официально не раскрывается, однако ранее сообщалось примерно об 1 Пфлопс в FP8. Huawei также использует собственную память HBM. В зависимости от конфигурации ускоритель может оснащаться объёмом памяти до 128 Гбайт при пропускной способности 1,6 Тбайт/с. Остальные технические параметры пока не уточняются.
Atlas 350 специально оптимизирован для этапа предварительного заполнения (Prefill) во время инференса — наиболее ресурсоёмкой стадии работы больших языковых моделей (LLM), когда выполняется обработка пользовательского запроса. Скорость выполнения этой операции напрямую влияет на показатель TTFT (Time To First Token), то есть время от ввода запроса до появления первого токена ответа. Благодаря этому Atlas 350 подходит для ИИ-приложений реального времени и агентных платформ. Одновременно Huawei объявила о планах масштабного обновления собственного портфеля СХД, включая системы OceanStor Dorado и All-Flash решения Pacific 9926. Помимо этого, компания разрабатывает платформу FusionCube A1000, предназначенную для быстрого развёртывания ИИ-систем в сегменте малого и среднего бизнеса.
«Если первая половина эпохи ИИ была сосредоточена вокруг вычислительной мощности, то вторая половина будет строиться вокруг данных. В 2026 году Huawei продолжит активно модернизировать свои системы хранения и принимать участие в масштабных национальных проектах по развитию соответствующей инфраструктуры», — заявил Юань Юань (Yuan Yuan), президент подразделения Huawei по системам хранения данных.