O “paradoxo da IA” é um obstáculo crescente para os líderes empresariais: investir milhões em GPUs poderosas, apenas para vê-los ficarem ociosos enquanto aguardam pelos dados. À medida que as empresas passam do projeto piloto para a produção, o verdadeiro gargalo não é a computação, mas o custo oculto de uma rede ineficiente. Em arquiteturas escaláveis, dezenas de milhares de GPUs devem ser sincronizadas para completar uma única iteração de treinamento. Quando a rede não consegue acompanhar as demandas intensas do treinamento de IA moderno, as GPUs param e o tempo de conclusão do trabalho (JCT) aumenta. Fizemos uma parceria com a AMD para fornecer uma infraestrutura de IA validada e completa que elimina esses gargalos e transforma a rede em um mecanismo de alto desempenho para inovação.
Material como base: o modelo de desempenho de IA da Cisco e da AMD
À medida que as cargas de trabalho de IA se expandem em clusters distribuídos, a rede deve ser dimensionada linearmente para evitar perda de pacotes e retransmissões. Este desempenho só é verificável através de benchmarking rigoroso e actual. Na Cisco, priorizamos o desempenho sistêmico e determinístico que vai além das especificações de componentes individuais.
Nossa arquitetura de referência apresenta GPUs AMD Intuition™ MI300X, NICs AMD Pensando™ Pollara 400, switches N9364E-SG2 com tecnologia Cisco Silicon One G200 e óptica Cisco 800G OSFP. A implantação é apenas metade do desafio; operar em escala é o outro. O Cisco Nexus Dashboard fornece a visibilidade granular e em tempo actual necessária para operações do dia 0 ao dia N.


Ao combinar essas tecnologias, minimizamos o JCT e maximizamos a utilização da GPU, garantindo que a infraestrutura de IA permaneça segura, compatível e continuamente otimizada.
Comparando a arquitetura
Comparamos duas topologias Clos (2×2 e 4×2) com switches Cisco N9364E-SG2 (cada um com taxa de transferência de 51,2 Tbps e 64 portas de 800 GbE), 128 GPUs AMD Intuition™ MI300X Sequence (16 servidores x 8 GPUs), 128 NICs AMD Pensando™ Pollara 400 AI (16 servidores x 8 NICs) e o Ecossistema de software program AMD ROCm™ 6.3/7.0.3.
Topologia Clos 2×2
Esse design assina totalmente cada change folha, forçando o change a estados de alto congestionamento para testar a resiliência da malha:
- 2 switches leaf e 2x Backbone (4x Cisco N9364E-SG2)
- 8 servidores (8x GPUs AMD Intuition™ MI300X Sequence) conectados a cada change leaf
- 8x NICs AMD Pensando™ Pollara 400G por servidor
- Lado do change: óptica Cisco OSFP 800G DR8


Topologia 4×2 Clos
Este projeto se concentra na eficácia de técnicas avançadas de balanceamento de carga para distribuição eficiente de carga durante rajadas síncronas na malha de expansão da GPU:
- 4 switches leaf e 2x Backbone (6x Cisco N9364E-SG2)
- 4 servidores (8 GPUs AMD Intuition™ série MI300X) conectados a cada change leaf
- 8x NICs AMD Pensando™ Pollara 400G por servidor
- Lado do change: óptica Cisco OSFP 800G DR8


Ferramentas de benchmarking
Medimos o desempenho da malha escalável usando um conjunto de ferramentas abrangente, incluindo:
- IBPerf mede o desempenho do RDMA em malha escalável em diversos cenários congestivos. Usamos essa ferramenta para testar o desempenho entre GPUs conectadas em uma única folha e na lombada da folha.
- MLPerf é uma referência padrão do setor usada para medir o desempenho actual da carga de trabalho. O resultado do desempenho se traduz em ROI em projetos totalmente validados da Cisco e da AMD.
Resultados de benchmarking de desempenho de malha de rede
Avaliamos o desempenho da malha escalável usando testes abrangentes e KPIs padrão.
Teste IBPerf de salto único avalia o desempenho em um domínio de malha localizado, normalmente em um change de folha única. Isso estabelece uma linha de base para a utilização do hyperlink, a eficácia do ajuste de buffer e o desempenho da NIC para o change antes da introdução de variáveis multi-hop.
Esses testes medem o rendimento das sessões de acesso remoto direto à memória (RDMA) entre duas GPUs conectadas por meio de um change leaf Cisco N9364E-SG2. Os resultados capturam a largura de banda P01 (1º percentil) e P99 (99º percentil), enquanto todas as sessões estão ativas simultaneamente. A largura de banda P01 representa o rendimento da sessão mais lenta – uma métrica crítica para o desempenho da carga de trabalho sincronizada de AI/ML – enquanto P99 representa o rendimento da sessão mais rápida. Um delta mínimo entre a largura de banda P01 e P99 e cada largura de banda mais próxima da largura de banda do hyperlink comprova a eficácia da tecnologia de interconexão GPU.
Na topologia de 2 folhas/2 colunas (2×2), cada change leaf lida com 32 sessões bidirecionais, saturando efetivamente o change leaf. A topologia de 4 folhas/2 lombadas (4×2) lida com 16 sessões bidirecionais por folha. Em ambas as topologias e contagens variadas de pares de filas (QPs) (4 QPs e 32 QPs), as larguras de banda P01 e P99 em ambas as topologias e ambos os conjuntos de pares de filas estão mais próximos um do outro, com cada um se aproximando da largura de banda do hyperlink de 400 Gbps.


Esse desempenho mostra que os switches AMD Pensando™ Pollara NIC e Cisco N9364E-SG2 oferecem uma solução altamente eficiente para cargas de trabalho exigentes. O pequeno delta entre as métricas P01 e P99 em diferentes escalas e configurações demonstra que essa arquitetura mantém um desempenho determinístico, independentemente do tamanho do cluster ou da densidade do par de filas.
Teste IBPerf bissecional avalia o tráfego entre estruturas que atravessa várias camadas para medir a largura de banda de bissecção, a simetria do caminho, o balanceamento de carga entre colunas e a propagação de congestionamento.
Esses testes medem o rendimento da sessão RDMA entre duas GPUs conectadas por meio de switches Cisco N9364E-SG2 folha e espinha. Os resultados mostram medições de largura de banda P01 e P99 com todas as sessões ativas simultaneamente. Na topologia 2×2, existem 32 sessões bidirecionais por folha, enquanto a topologia 4×2 possui 16 sessões bidirecionais por folha. Todas essas sessões passam pela espinha. O tráfego de cada sessão percorre três saltos (folha-lombada-folha) para tensionar toda a estrutura. Este teste valida a eficiência do algoritmo de balanceamento de carga da malha; qualquer polarização de tráfego levaria à subutilização de alguns hyperlinks, enquanto outros hyperlinks ficariam congestionados, degradando, em última análise, o desempenho da sessão RDMA. Os testes foram realizados usando 4 e 32 QPs.


Os resultados demonstram que as larguras de banda P01 e P99 são semelhantes e cada uma está mais próxima da largura de banda do hyperlink de 400 Gbps, refletindo o desempenho observado nos testes de salto único. Isso confirma que os switches Cisco N9364E-SG2 e a NIC AMD Pensando™ Pollara fornecem uma tecnologia de interconexão de GPU resiliente e de alto desempenho, capaz de manter um desempenho determinístico consistente sob estresse.
Teste IBPerf congestivo cria cenários de alta contenção usando um padrão de comunicação 31:1, onde 31 GPUs se comunicam com uma única GPU. Ele avalia o acúmulo de filas, a eficácia da notificação explícita de congestionamento (ECN), as curvas de reação da notificação quantizada de congestionamento do information heart (DCQCN), a latência closing e a estabilidade da malha sob os piores padrões de comunicação de IA.
As condições de incast representam alguns dos cenários mais desafiadores para a estrutura de IA em escalabilidade horizontal. Esses testes medem as larguras de banda P01 e P99 sob condições incast, que se manifestam durante comunicações coletivas, como tudo para todos. Se o {hardware}, o design e o ajuste da malha de expansão não forem ideais, isso levará a uma degradação substancial no JCT para cargas de trabalho de treinamento. Como é difícil sincronizar todas as sessões para iniciar simultaneamente, utilizamos o Método de Faixa Quantílica para analisar os resultados. Ele analisa amostras de largura de banda como resultado de congestionamento de transmissão em vez de todas as amostras de largura de banda.


Neste teste, cada uma das 128 GPUs estabelece 31 sessões RDMA para 31 outras GPUs na malha leaf-spine, resultando em um whole de 3.968 (31*128 = 3.968) sessões ativas simultaneamente na malha de expansão. O delta entre a largura de banda P01 e P99 é muito estreito, e cada largura de banda está próxima da largura de banda do hyperlink de 400 Gbps, o que é uma prova sólida da capacidade dos switches Cisco N9364E-SG2 de lidar com condições extremas de congestão e uma prova do design validado pela Cisco e pela AMD.
Treinamento MLPerf e benchmarking de inferência os testes estabelecem métricas padronizadas para avaliar o desempenho das cargas de trabalho de treinamento e inferência. Ao impor diretrizes rígidas em relação a modelos, conjuntos de dados e otimizações permitidas, esses benchmarks fornecem condições equitativas para comparação justa entre soluções de infraestrutura de IA concorrentes.
Os testes MLPerf da MLCommons são projetados para fornecer uma metodologia de benchmarking comum para medir KPIs em nível de aplicativo, que são os principais indicadores de desempenho para usuários finais. Para inferência, os resultados do Llama 2 70B demonstram um claro dimensionamento de rendimento à medida que a configuração se expande de dois para quatro nós. Os benchmarks de treinamento fornecem dados representativos para o Llama 2 70B (em dois nós) e o Llama 3.1 8B (em oito nós).


Essas descobertas fornecem a base para nossa afirmação principal: a arquitetura validada pela Cisco não é apenas teoricamente sólida; o benchmarking mostra que ele pode lidar com as cargas de trabalho de treinamento e inferência de IA mais exigentes.
Uma implantação no mundo actual da arquitetura de solução de IA da Cisco e da AMD
A parceria Cisco-AMD proporciona impacto no mundo actual, principalmente potencializando G42clusters de IA em grande escala. Esse solução ponta a ponta—integrando GPUs AMD, servidores Cisco UCS, switches N9000 800G e Nexus Dashboard — fornece o desempenho seguro e escalonável necessário para cargas de trabalho de IA de ponta.
“À medida que as cargas de trabalho de IA aumentam, o desempenho da rede se torna um facilitador crítico da eficiência do cluster. A NIC AMD Pensando™ Pollara 400 AI, com seu design totalmente programável e resistente a falhas, oferece desempenho consistente para treinamento de expansão de GPU. Em colaboração com a comutação Cisco N9000, estamos levando a Ethernet para o próximo nível, ajudando a maximizar a utilização da GPU e acelerar a conclusão do trabalho.”
—Yousuf Khan, vice-presidente corporativo, grupo de tecnologia e soluções de rede, AMD
Operacionalizando a inteligência: um novo padrão para desempenho em escala
Na period da IA em grande escala, a infraestrutura de uma organização é a sua maior vantagem competitiva ou o seu gargalo mais significativo. Quando o que está em jogo envolve treinamento, ajuste fino e inferência de missão crítica, um ecossistema unificado e totalmente validado é essencial. A Cisco e a AMD estão mudando a equação, oferecendo uma malha determinística e de alto desempenho que transforma sua rede em um catalisador para inovação.
Conecte-se hoje mesmo com um especialista em redes de IA da Cisco para projetar uma implantação personalizada para suas cargas de trabalho específicas.
Recursos adicionais: