Оглавление
ToggleПоявление искусственного интеллекта сильно изменило наш образ жизни. Мы можем делать все с легкостью и получать все более эффективные способы. Чтобы сети могли в полной мере использовать возможности искусственного интеллекта, они должны сочетать в себе высокопроизводительную связь и отсутствие потерь пакетов.
Мартин Халл, вице-президент по управлению продуктами для облачных титанов и платформ компании Arista Networks, говорит, что проблема заключается в том, что современные традиционные сетевые соединения не могут обеспечить масштаб и пропускную способность, необходимые для удовлетворения запросов ИИ. Исторически единственными вариантами соединения процессорных ядер и памяти были проприетарные интерконнекты, такие как InfiniBand, PCI Express и другие протоколы для подключения вычислительных кластеров и их разгрузки, но в большинстве случаев они не подходят для искусственного интеллекта и его требований к рабочим нагрузкам.
Arista Artificial Intelligence Spine
Для решения этих проблем компания Arista разрабатывает технологию под названием AI Spine, для которой необходимы коммутаторы для центров обработки данных с глубокими буферами пакетов и сетевое программное обеспечение, обеспечивающее мониторинг в реальном времени, чтобы помочь управлять буферами и эффективно контролировать трафик.
“Мы начинаем видеть, что волна искусственного интеллекта, Приложения, основанные на естественном языке и машинном обучении, с огромными объемами данных, распределенными между сотнями или тысячами процессоров (CPU, GPU), каждый из которых нагружен вычислением задачи, разбиением ее на части, обработкой каждой части и отправкой ее обратно”, - говорит Халл.
“Если ваша сеть ошибается в сторону падения трафика, это означает, что запуск рабочей нагрузки искусственного интеллекта задерживается, потому что вам приходится повторно передавать ее. Если в процессе обработки этих рабочих нагрузок искусственного интеллекта трафик снова перемещается туда-сюда, это замедляет работу искусственного интеллекта. Скорость их работы снижается, и они могут выйти из строя”.”

Искусственный интеллект позвоночник Архитектура
Ариста искусственный интеллект Spine базируется на серии коммутаторов для центров обработки данных 7800R3, которые поддерживают коммутационную емкость 460 Тбит/с, сотни интерфейсов 40 Гбит/с, 50 Гбит/с, 100 Гбит/с или 400 Гбит/с и буферы глубиной 384 ГБ на верхнем конце.
“Буфер глубины - это ключ к тому, чтобы поддерживать поток и ничего не терять”, - говорит Халл. “Некоторые люди беспокоятся о задержках в больших буферах, но наш анализ не показывает, что это происходит в данном случае”.”
Система искусственного интеллекта будет управляться основным сетевым программным обеспечением Arista, Extensible Operating System (EOS), которое поддерживает сети на базе Ethernet с высокой пропускной способностью, без потерь и с низкой задержкой, способные объединять тысячи графических процессоров на скоростях 100, 400 и 100 Гбит/с. Согласно техническому описанию системы искусственного интеллекта Spine, скорость 800 Гбит/с и схема распределения буферов.
По словам представителей Arista, коммутаторы и пакеты EOS создают ткань, которая разбивает пакеты и переформатирует их в единые по размеру блоки, "распыляя" их равномерно по всей ткани. Цель состоит в том, чтобы обеспечить равный доступ ко всем доступным путям внутри ткани и исключить потерю пакетов.
“Архитектура на основе ячеек не заботится о скорости соединения на передней панели, и смешивание и сопоставление 100, 200 и 400 Гбит/с не требует особых усилий”, - пишет Arista. Кроме того, ячеистая структура делает ее невосприимчивой к проблеме “столкновения потоков‘ в сетях Ethernet. Внутри коммутатора используется механизм распределенного планирования для обеспечения справедливости для трафика, конкурирующего за доступ к перегруженным выходным портам’.”
Поскольку каждый поток использует любой доступный путь для достижения пункта назначения, структура хорошо подходит для обработки "слоновьих потоков" с высоким трафиком, характерных для приложений AI/ML, поэтому "в сети нет внутренних "горячих точек", - пишет Arista.
Модель позвоночника с искусственным интеллектом
Чтобы объяснить, как работает позвоночник искусственного интеллекта, в техническом документе Arista приводятся два примера.
Во-первых, выделенная конструкция Arista 7800 подключается примерно к сотням серверных стоек, а интеллектуальные функции балансировки нагрузки EOS будут контролировать трафик между серверами, чтобы избежать конфликтов.
Классификация QoS, явное уведомление о перегрузке (ECN) и пороговые значения приоритетного управления потоком (PFC) настраиваются на всех коммутаторах, чтобы избежать потери пакетов. Анализатор задержек (LANZ) Arista EOS определяет соответствующие пороги, чтобы избежать потери пакетов при сохранении высокой пропускной способности, и позволяет масштабировать сеть, сохраняя задержки предсказуемыми и низкими.
Второй вариант использования может достигать сотен конечных точек, подключая все режимы GPU непосредственно к коммутатору 7800R3 в позвоночнике искусственного интеллекта. В результате получается ткань, которая обеспечивает один переход между всеми конечными точками, снижая задержки и обеспечивая единую, большую сеть без потерь, не требующую конфигурации или настройки, пишет Arista.

Проблемы сетевого искусственного интеллекта
Спрос на архитектуру искусственного интеллекта Spine в основном обусловлен такими технологиями и приложениями, как виртуализация серверов, контейнеризация приложений, мультиоблачные вычисления, Web 2.0, большие данные и высокопроизводительные вычисления. Для оптимизации и повышения производительности этих новых технологий используются распределенные масштабируемые IP-ткани с глубокой буферизацией, которые обеспечивают стабильную производительность и могут масштабироваться для поддержки экстремальных моделей трафика “восток-запад‘’, - пишет Arista.
Хотя большинству предприятий, возможно, еще рано беспокоиться о работе с крупными кластерными рабочими нагрузками искусственного интеллекта, некоторые крупные среды, а также сети гипермасштабирования, финансовые сети, сети виртуальной реальности, игровые сети и сети разработки автомобилей уже готовятся к перебоям в трафике, которые они могут вызвать. . традиционная сеть.
Генеральный директор компании Arista Джайшри Уллал недавно заявил в интервью Goldman Sachs, что по мере роста рабочих нагрузок, связанных с искусственным интеллектом, они оказывают все большее давление на масштабы и пропускную способность сетей, а также на правильное хранение данных и глубину буферов с предсказуемой задержкой. Конвергенция технологий. “Чтобы заставить устаревший Ethernet работать в качестве внутренней сети для поддержки этой технологии в будущем, потребуется много инженерных решений, а растущее использование 400G придаст дополнительный импульс этому развитию”, - говорит Уллал.