Восемь ускорителей выполняют один all-reduce, но название этой операции ничего не говорит о проводах между ними. В системах Ascend программа вызывает HCCL, а данные могут идти через HCCS, RoCE, PCIe или UnifiedBus. Документация CANN 9.1.X перечисляет все четыре транспорта. Доступный набор зависит от оборудования и версии программного стека.

В сентябре 2026 года Huawei заявила, что в архитектуре UnifiedBus, по-китайски 灵衢, уже объединила более десяти протоколов межсоединения. Это заявление о новой архитектуре систем. Библиотека HCCL обслуживает несколько поколений Ascend и сохраняет поддержку разных транспортов. По её списку нельзя судить ни о наличии UB в конкретном сервере, ни о том, какой путь использует запущенная задача.

Программа зовёт библиотеку

Возьмём задачу распределённого обучения на ускорителях Ascend. На каждом шаге процессоры обмениваются результатами, например выполняют all-reduce: складывают частичные суммы и раздают итог всем участникам. Программа не прокладывает маршрут сама. Она вызывает функцию HCCL, Huawei Collective Communication Library.

Библиотека выполняет обмен через поддерживаемое межсоединение. HCCS может связывать процессоры внутри сервера и между серверами: документация Atlas A3 прямо описывает SDMA-обмен по HCCS между AI Servers в суперузле. RoCE использует сетевой путь, PCIe и UB дают другие варианты аппаратного соединения. Разделение «HCCS только внутри сервера, RoCE всегда снаружи» для такой системы было бы ошибочным.

Библиотека HCCL и транспорты под ней

Открыть схему в полном размере

Программа вызывает HCCL; библиотека использует доступный путь: HCCS, RoCE, PCIe или UB. Набор путей зависит от продукта и версии.

Какой путь доступен, документация HCCL говорит прямо: на той же странице есть список поддерживаемых продуктов, от Ascend 950PR и 950DT до систем Atlas A3 и A2, с оговорками по конкретным серверам. Наличие четырёх транспортов в списке библиотеки не означает, что все четыре есть на любой машине.

Три имени, три уровня

Названия относятся к разным частям системы: HCCL описывает программные операции, HCCS аппаратное соединение, UB архитектуру межсоединения и её протокол.

Имя Что это Уровень Где описано
UnifiedBus, UB, 灵衢 Архитектура межсоединения для суперузлов: протокол, семантика памяти, коммутация Архитектура и протокол Сообщество UnifiedBus, белая книга
HCCS Huawei Cache Coherence System, высокоскоростное соединение CPU и NPU Аппаратное соединение Глоссарий Ascend
HCCL Huawei Collective Communication Library, библиотека коллективных операций Программное обеспечение Документация CANN 9.1.X

В расшифровке HCCS есть слово coherence, когерентность. Из этого названия нельзя вывести свойства всей памяти суперузла UB. В том же глоссарии Ascend встречается HCCP, Huawei Collective Communication Adaptive Protocol. Само определение термина не устанавливает обязательный промежуточный слой над всеми четырьмя транспортами HCCL.

Как шина обращается к памяти

Архитектуру UB описывает белая книга референсной архитектуры суперузла версии 6.0.0.

Главная идея там названа межсоединением шинного класса. Обычная сеть передаёт сообщения: отправитель упаковывает данные, получатель распаковывает. Шина работает с адресами памяти: процессор читает или записывает по адресу, даже если память физически находится в другом устройстве. Белая книга обещает для синхронного доступа с семантикой памяти задержку в сотни наносекунд, для асинхронного от 2 до 5 микросекунд, а между компонентами полосу порядка терабайт в секунду.

Стек описан в восемь уровней, от физического до управления. На функциональном уровне программы получают две модели: обычные load и store, как при работе с локальной памятью, и URMA, единый удалённый доступ к памяти. Блок UMMU переводит глобальные адреса в локальные и проверяет права доступа. Ресурсы можно объединять в пулы через разделы UB и одалживать память между узлами. Для связи между кластерами предусмотрен UBoE, перенос транзакций UB поверх Ethernet и IP. В родной фабрике UB транзакции идут по её собственному стеку, а при UBoE переносятся внутри сетевых пакетов.

Слово unified, единая, не означает, что вся память суперузла когерентна на любом расстоянии. Белая книга такого свойства для всего суперузла не заявляет; поддержание актуальности кэша упоминается лишь для отдельных видов транзакций. Порядок обращений, когерентность и точные модели доступа описывает нормативная спецификация, доступная на условиях отдельного лицензионного соглашения.

Сентябрьские документы

18 сентября 2026 года на форуме в рамках Huawei Connect в Шанхае сообщество UnifiedBus выпустило два документа: базовую спецификацию 2.1 и спецификацию тестов совместимости 2.0, том 1. По описанию на главной странице сообщества, версия 2.1 добавляет скорости 224 и 256 Гбит/с, надёжную перемаршрутизацию и снижение задержки при многопутевой передаче. Тестовый том содержит проверки физического, канального и сетевого уровней.

Белая книга доступна по лицензии CC BY 4.0. Получение базовой и тестовой спецификаций требует согласия с отдельной лицензией; описание архитектуры в белой книге не заменяет их нормативных требований при разработке совместимого устройства.

Сентябрьский отчёт о форуме описывает и работу партнёров над аппаратной экосистемой.

На форуме выступил заместитель генерального директора шэньчжэньского разработчика микросхем 楠菲微电子. По его словам, работа компании над IP-блоком UB началась во втором квартале 2026 года, тестирование совместимости с другими участниками запланировано на конец года, а выпуск микросхем IO Die и коммутатора ожидается к 2028 году. Это план одной компании-партнёра, а не дорожная карта всего сообщества, и уже выпущенными эти изделия считать нельзя.

Объявление Huawei

Одновременно Huawei представила три устройства. UnifiedBus LinkBlade соединяет процессоры внутри шкафа без кабельной разводки; по заявлению компании, в суперузле на 4096 NPU он экономит около 196 километров медного кабеля. UnifiedBus LinkDevice связывает шкафы между собой: 176 портов по 1,6 Тбит/с и 280 Тбит/с полностью оптического межсоединения, с задержкой туда и обратно от 2 микросекунд. Коммутатор UBG заявлен с числом портов до 1024 для кластеров на миллион ускорителей.

176 × 1,6 даёт 281,6 Тбит/с, тогда как суммарная полоса в объявлении равна 280 Тбит/с. Релиз не объясняет разницу: округление возможно, но не установлено. Также не указано, суммируются ли направления. Единица здесь биты, Тбит/с; 1,6 Тбит/с соответствует 200 ГБ/с после простого перевода единиц, до учёта служебного трафика и условий измерения.

RTT, round-trip time, это время пути туда и обратно. Сравнивать его с односторонней задержкой других систем нельзя, а для 2 микросекунд Huawei не называет ни размер сообщения, ни нагрузку, ни точки замера. В том же объявлении есть и второе утверждение, о снижении RTT с 7 до 2 микросекунд при объединении протоколов, и это уже не характеристика устройства, а оценка эффекта архитектуры. Обе оценки принадлежат Huawei. Для сравнения с другой системой нужны одинаковые операции, размеры сообщений и точки измерения.

Национальный документ без слова UnifiedBus

На государственном портале стандартов Китая зарегистрированы два проекта с общим названием «единый протокол вычислительной высокоскоростной межсоединительной шины»: общие положения под номером 20262599-Z-469 и технические требования к межсоединению суперузла с равноправной архитектурой под номером 20262600-Z-469. Они зарегистрированы 6 и 7 мая 2026 года, ведёт их технический комитет по информационным технологиям TC28, срок работы 12 месяцев, статус «на рассмотрении».

Слова UnifiedBus или 灵衢 в карточках нет. Разработчиком первым указан Китайский институт стандартизации электроники, а дальше идут более шестидесяти организаций, среди них Huawei, ZTE, Hygon, Cambricon, Moore Threads, Biren, Kunlunxin и T-Head. Фирменная технология одной компании и отраслевой документ многих участников связаны темой, но это не одно и то же.

Есть и формальная деталь. Буква Z в номере означает руководящий технический документ, будущий GB/Z, а не национальный стандарт GB/T. Пока оба документа остаются проектами на рассмотрении, а не действующими нормами. Рядом на портале есть третья часть того же семейства, о требованиях к соединению ускорителей, зарегистрированная в конце 2025 года и тоже находящаяся на рассмотрении.

Один all-reduce, разные ограничения

Допустим, восемь ускорителей хранят по массиву из миллиона 32-битных чисел. Каждый локальный массив занимает 4 МБ в десятичных единицах. После all-reduce с суммированием каждый участник должен получить массив того же размера, в котором каждый элемент содержит сумму восьми исходных значений. Объём результата на одном ускорителе остаётся 4 МБ; умножение на число участников даёт 32 МБ копий результата во всей группе. Ни одно из этих чисел само по себе не равно объёму трафика на каждой линии: он зависит от алгоритма обмена и маршрутов.

Если все участники подключены через HCCS, библиотека может использовать этот поддерживаемый путь. При переносе той же задачи на систему с другим соединением вызов коллективной операции сохраняет смысл, но время обмена меняется. Проверять нужно также размер группы: результат теста между двумя ускорителями не описывает работу восьми участников, одновременно занимающих общие линии. Для маленьких массивов особенно заметны запуск операции и синхронизация; для больших растёт роль устойчивой полосы передачи.

Удобный практический тест состоит из нескольких размеров массива при неизменном числе участников. Затем число участников увеличивают, сохраняя размеры и тип данных. Так можно увидеть, на каком переходе меняется время операции: при добавлении ускорителя в том же сервере, при выходе в соседний сервер или за пределы суперузла. Вместе со временем нужно сохранять фактически использованный транспорт. Иначе два запуска HCCL с одинаковым названием операции могут оказаться проверками разных аппаратных путей.

Семантика памяти UB добавляет ещё один вопрос: где лежат данные, к которым обращается процессор. Возможность адресовать удалённую память не делает её физически локальной. Если рабочий набор перенесён в другой узел, обращения проходят через межсоединение и конкурируют с остальным трафиком. Поэтому сравнение должно сохранять размещение данных или явно учитывать его изменение. Заявленную задержку доступа к памяти нельзя подставлять вместо времени всего all-reduce: коллективная операция включает несколько участников и собственную последовательность обменов.

Что нужно, чтобы программа заработала

Заявленная Huawei унификация не отменяет проверки конкретной конфигурации. Программа получит тот транспорт, который поддерживают её оборудование и версия ПО.

Чтобы понять, какой именно, нужно выяснить:

  1. Модель ускорителя Ascend и системы, в которой он стоит.
  2. Версию CANN и то, входит ли этот продукт в список поддерживаемых для HCCL.
  3. Какие транспорты есть у машины и между нужными серверами: HCCS, RoCE, PCIe, UB.
  4. Топологию: сколько процессоров в узле и в суперузле, как они соединены.
  5. Версии драйвера и прошивки и права доступа к устройствам.
  6. Средства наблюдения: как увидеть, по какому пути на самом деле идёт обмен.
  7. Независимый замер нужной операции на своей задаче.

Конфигурация становится воспроизводимой, когда вместе с результатом теста сохранены модель системы, схема соединений, версии ПО и параметры операции. Как ту же задачу решают NVIDIA, AMD и открытые консорциумы, рассказывают статьи о NVLink и Infinity Fabric и о UALink и ESUN, а сетевую основу RoCE разбирает статья о RDMA и Ultra Ethernet.