Escalabilidade horizontal: por que o futuro da IA ​​distribuída não está em um information middle


Durante anos, as organizações aproveitaram a IA/ML para tarefas específicas, desde a visão computacional na análise de vídeo até o BERT do Google, que potencializa a pesquisa avançada e os modelos de ML que impulsionam a análise preditiva. Os líderes da indústria são pioneiros há muito tempo na pesquisa em modelos de processamento de linguagem pure (PNL) para reconhecimento de fala, resumo de texto e análise de sentimento, mas o lançamento do ChatGPT marcou o início do renascimento da IA ​​e da period da IA ​​generativa. Da noite para o dia, a IA deixou de ser um conceito futurista para se tornar uma ferramenta colaborativa diária essencial. A ascensão de grandes modelos de linguagem (LLMs) e da IA ​​generativa acelerou ainda mais a inovação international, interrompeu os fluxos de trabalho estabelecidos e forçou todas as principais indústrias a reimaginar produtos e soluções.

Hoje, todas as organizações – desde pequenas empresas até aos maiores fornecedores de cloud – devem decidir como integrar esta tecnologia e permanecer à frente no cenário de IA em rápida evolução.

Os fundamentos dos tecidos de IA

Os blocos de construção de um ambiente de cluster de IA de alto desempenho incluem aceleradores, servidores de armazenamento e estruturas de rede que conectam esses servidores (Figura 1).

Escalabilidade horizontal: por que o futuro da IA ​​distribuída não está em um information middleEscalabilidade horizontal: por que o futuro da IA ​​distribuída não está em um information middle
Figura 1. Arquitetura de malha de IA para conectividade norte-sul e leste-oeste

O tecido frontal: Isso atua como um gateway para seu cluster de GPU, gerenciando o tráfego padrão do information middle, incluindo acesso de usuário norte-sul, chamadas de API, registro e ingestão de dados de armazenamento ou information lakes para as GPUs.

  • Projeto: Ele transporta tráfego RDMA e não RDMA. Como o tráfego costuma ser intermitente, o excesso de assinaturas é aceitável e comumente implementado nessa estrutura.
  • Vantagem Cisco: As soluções desagregadas das séries Cisco N9000 e 8000 com tecnologia Silicon One oferecem a funcionalidade robusta necessária para suportar essa estrutura.

O tecido backend: Também conhecida como malha “scale-out”, ela fornece uma interconexão de alta velocidade e baixa latência para comunicação coletiva de GPU para GPU (tráfego leste-oeste).

  • Projeto: Uma malha sem perdas e sem bloqueio (assinatura 1:1), crítica para comunicação sincronizada. Seu tamanho depende diretamente do número de GPUs e da velocidade da interface NIC associada.
  • Vantagem Cisco: As soluções desagregadas das séries Cisco N9000 e 8000 com tecnologia Silicon One fornecem o balanceamento de carga avançado e o gerenciamento de congestionamento necessários para manter esse alto rendimento.

Quando a ambição da IA ​​supera o information middle

À medida que os requisitos de infraestrutura de IA crescem, os hiperscaladores, as neonuvens, as nuvens soberanas e as grandes empresas devem repensar a forma como constroem clusters de IA. Enfrentando a limitação de energia e espaço em locais individuais, as operadoras devem construir information facilities distribuídos para atender às crescentes demandas de treinamento e inferência de LLMs de trilhões de parâmetros.

Como um único cluster não pode lidar com cargas de trabalho dessa escala, é necessário um ecossistema distribuído com suporte de uma estrutura escalonável.

Unificando o ecossistema distribuído com escalabilidade em toda a estrutura

À medida que os information facilities que suportam aplicações de IA/ML se tornam mais distribuídos, a escala em toda a estrutura serve como uma interconexão very important. Essa arquitetura permite que clusters de IA transcendam os limites de um único native, abrangendo diversas instalações para superar restrições de espaço e energia. Ao se expandirem geograficamente, as operadoras podem otimizar custos e energia, ao mesmo tempo em que liberam o pool de capacidade, a resiliência estendida e o crescimento contínuo e contínuo. Ao interconectar information facilities que abrangem centenas de quilômetros, as operadoras não estão apenas adicionando hyperlinks – elas estão formando uma infraestrutura de IA em megaescala que abrange vários locais.

Qualquer que seja a arquitetura de malha em vigor, a Cisco defende uma abordagem baseada em Ethernet porque fornece a escala, a interoperabilidade e a maturidade do ecossistema necessárias para a infraestrutura moderna de IA (Figura 2). À medida que as velocidades de interface evoluem para 1,6 Tbps e além, a Ethernet continua sendo o único caminho viável que oferece a enorme largura de banda leste-oeste e o desempenho necessário para o investimento em IA preparado para o futuro.

Figura 2. A Ethernet unifica o modelo operacional de IA — do escalonamento horizontal ao escalonamento horizontal

Projetando um tecido em escala para desempenho splendid

A escalabilidade horizontal não é uma solução arquitetônica que sirva para todos. Cada ambiente é único, e as restrições de design, desde a distância até os padrões de tráfego, podem impactar significativamente o desempenho do cluster de IA. Para arquitetar uma arquitetura escalável de forma eficaz, várias questões críticas devem primeiro ser abordadas, incluindo:

  • A distância geográfica é um fator que influencia as estruturas de front-end e back-end?
  • Os tecidos de front-end e back-end podem ser estendidos? Em caso afirmativo, existem compensações de desempenho?
  • O buffer profundo é necessário? A que distância isso se torna uma necessidade?
  • Como as NICs RDMA, os switches e a pilha de AI/ML devem ser ajustados para lidar com a distância e o excesso de assinaturas?
  • Como os projetos de treinamento e inferência devem evoluir para garantir um desempenho splendid?

O objetivo principal de uma malha escalável é conectar vários clusters de IA, para que eles se comportem como uma única entidade lógica (Figura 3). No entanto, como as malhas frontend e backend servem a propósitos completamente diferentes, estendê-las apresenta desafios arquitetônicos distintos.

  • Estendendo o back-end: Isso atua como o mecanismo de alta velocidade do cluster e é ultrassensível à perda e atraso de pacotes. À medida que a distância aumenta, surgem gargalos, paralisando a sincronização da GPU, exigindo ajuste da estrutura da rede e redesenho da carga de trabalho para mitigar os impactos.
  • Estendendo o front-end: Isso serve como porta de entrada para a infraestrutura. Embora um certo nível de perda de pacotes e latência possa ser tolerável dependendo da natureza da carga de trabalho, o ajuste proativo da estrutura da rede é necessário para otimizar o desempenho.
Figura 3. Conectando malhas de IA/ML de front-end e back-end em information facilities

Compreender as variáveis ​​do sucesso da IA ​​distribuída

Quando o alcance da rede é estendido para além de um information middle, os princípios de design subjacentes mudam. As organizações não lidam mais com uma topologia de rede simples. Quatro variáveis ​​críticas definem o sucesso desta arquitetura, incluindo:

  • Distância: Embora as distâncias intradata facilities sejam normalmente de 50 a 100 metros, a escala entre malhas pode abranger centenas de quilômetros. A distância é o maior fator na degradação do desempenho do RDMA e determina exatamente até onde a estrutura da rede pode ser empurrada antes de encontrar graves degradações de desempenho.
  • Excesso de assinaturas: Construir uma malha sem bloqueio continua sendo o padrão ouro, mas muitas vezes tem um custo proibitivo para largura de banda de longa distância. Os arquitetos de rede devem equilibrar a taxa de excesso de assinaturas, mantendo-a mais baixa para o back-end para garantir uma comunicação robusta entre GPU e GPU, ao mesmo tempo em que permitem uma taxa mais alta ao estender a estrutura do front-end.
  • Buffer profundo: Esta variável depende inteiramente de restrições ambientais e não existe uma solução genérica. Se uma arquitetura requer buffers profundos ou não, depende completamente do perfil de distância específico e das taxas de excesso de assinaturas implantadas.
  • Óptica de longo alcance: A degradação do sinal ao longo das distâncias é uma restrição física inevitável. A dispersão cromática, a atenuação da fibra e os efeitos não lineares degradam a integridade do sinal. Escolher a óptica certa – desde soluções coerentes estendidas de curto alcance (SR) até soluções coerentes estendidas de longo alcance (ZR+) – é very important, e testes rigorosos continuam sendo a única maneira de confirmar o desempenho actual.

Arquitetura baseada em evidências: insights do Cisco Zeus AI Lab

A interconexão de locais de information facilities distribuídos introduz profundas complexidades arquitetônicas (Figura 4). As empresas não precisam enfrentar obstáculos de interconexão por tentativa e erro.

Figura 4: A Cisco fornece um modelo comprovado para manter as cargas de trabalho de IA distribuídas estáveis ​​e otimizadas em qualquer escala

A equipe dedicada de engenharia de benchmarking de infraestrutura de IA da Cisco conduz pesquisas empíricas rigorosas para estabelecer projetos de referência comprovados e validados. Esta metodologia de testes sistemáticos abrange recursos críticos de rede, incluindo:

Ferramentas de avaliação de desempenho e principais métricas

  • Teste de desempenho mede o desempenho bruto do RDMA, estabelecendo a referência basic para todas as comunicações de rede em estruturas de front-end e back-end. A principal métrica rastreada é o rendimento da sessão.
  • Comparativo de mercado da Biblioteca de Comunicações Coletivas NVIDIA (NCCL) avalia a eficiência dos padrões de comunicação coletiva GPU para GPU, que influenciam diretamente o desempenho de aplicativos de nível superior.
  • Comparativo de mercado MLCommons MLPerf quantifica métricas de aplicativos ponta a ponta, especificamente o tempo de conclusão do trabalho (JCT) e a taxa de transferência de tokens, servindo como indicadores finais de agilidade operacional e ROI de infraestrutura.

Testar topologia e casos de uso de arquitetura

  • Extensão de front-end valida uma arquitetura de malha escalável que interconecta as redes front-end de dois locais distintos de information middle.
  • Extensão de back-end avalia uma arquitetura de malha escalável que conecta as redes back-end de alta velocidade de dois locais de information middle separados geograficamente.

Ambientes físicos e operacionais

  • Infraestrutura de fibra os testes abrangem uma ampla gama de distâncias físicas, variando de 100 metros a centenas de quilômetros.
  • Transceptores ópticos são implantados a partir de uma seleção escalonada de módulos ópticos – incluindo Far Attain (FR), Knowledge Heart Attain (DR), Lengthy Attain (LR) e tecnologias ZR/ZR+ coerentes – alinhados estritamente com as classificações de distância específicas e perfis de atenuação dos caminhos de fibra.

Ajuste de desempenho e otimização de infraestrutura

  • Gestão de congestionamento estabelece métricas de desempenho de linha de base antes de implementar estratégias de ajuste ativas para mitigar a degradação. Este processo concentra-se em neutralizar os impactos duplos da distância física e dos índices de excesso de assinaturas.
  • Mecanismos para evitar congestionamentos implantar balanceamento de carga em nível de fluxo (FLLB) na estrutura de front-end para gerenciar o perfil misto de tráfego RDMA e não RDMA, enquanto utiliza roteamento adaptativo altamente eficiente na estrutura de back-end.
  • Otimização de parâmetros NIC e NCCL ajustar variáveis ​​críticas nas camadas RDMA e NCCL. Essa otimização é very important à medida que as distâncias aumentam, garantindo que o pipeline da rede permaneça totalmente saturado mesmo com o aumento do tempo de ida e volta (RTT).
  • Alinhamento de paralelismo de modelo analisa como a distância geográfica determina o design estrutural das cargas de trabalho de IA, orientando a configuração splendid de esquemas de tensor, pipeline e paralelismo de dados para alcançar desempenho máximo e alto ROI.

O modelo arquitetônico para infraestrutura de IA de próxima geração

Embora os padrões formais da indústria para estruturas de IA distribuídas ainda não estejam estabelecidos, a pesquisa outline três níveis distintos para orientar a arquitetura da infraestrutura de IA (Figura 5):

  • Escalabilidade do campus que pode abranger 100 metros a vários quilômetros
  • Escala metropolitana que pode abranger vários quilômetros até dezenas de quilômetros
  • Escala regional que pode abranger centenas de quilômetros e além
Figura 5: Como a distância altera o design da arquitetura escalonada

O futuro da infraestrutura de IA já não é definido apenas pela capacidade computacional isolada; é definido pela conectividade da estrutura que transcende as fronteiras geográficas físicas. À medida que as organizações refinam as estratégias de information middle para a próxima onda de inovação, a questão arquitetônica definidora permanece: sua estratégia de expansão está preparada para o que vem a seguir?

A evolução da infraestrutura de IA em megaescala introduz complexidades sem precedentes. Em uma próxima série de blogs técnicos, desconstruiremos cada uma dessas camadas arquitetônicas escalonadas. Esta série fornecerá insights empíricos e recomendações baseadas em dados derivadas do Cisco Zeus AI Lab, permitindo que as organizações implantem e dimensionem clusters distribuídos com previsibilidade e confiança.

Recursos adicionais:

Deixe um comentário

O seu endereço de e-mail não será publicado. Campos obrigatórios são marcados com *