Ampliação, expansão e expansão são o centro das atenções na OFC


Kannan Raj, arquiteto da Oracle, abriu a cortina sobre as três dimensões de conectividade que definem as redes da period da IA ​​e como a inovação óptica está capacitando a estrutura de rede de IA que abrange todo o mundo

Uma das maiores preocupações da indústria de tecnologia foi exposta na OFC em Los Angeles na semana passada. A IA está em toda parte e tem o potencial de quebrar a estrutura atual do information middle.

“Na época em que as especificações do IEEE foram formadas e descartadas, eles disseram, precisávamos que os hyperlinks tivessem erro de efeito 2.4e-4. Isso de forma alguma é aceitável hoje”, disse Kannan Raj, arquiteto de infraestrutura de IA da Oracle, durante um painel de discussão. “Não podemos entregar um tecido saudável com esse tipo de especificação.”

Ficou bem claro que a IA não é apenas mais uma nova aplicação; está forçando os information facilities a serem ampliados, expandidos e ampliados. Essa mensagem foi entregue ao coração da OFC, servindo como um lembrete de que a rede está evoluindo de dentro para fora.

“Estamos lidando com milhões de hyperlinks, milhões de unidades, componentes, {hardware}. Eu chamo isso de tirania dos grandes números”, disse Raj. “Quando você tem grandes números em operação, as coisas falharão. As coisas quebrarão”, observando que o tempo médio até a falha é especialmente curto com esse tipo de número.

Apesar disso, a estrutura deve permanecer funcional, pois qualquer evento único de falha pode interromper grandes cargas de trabalho de treinamento, enviando-as de volta ao ponto de verificação anterior, causando enorme perda de tempo e recursos. Escusado será dizer que quando os parâmetros do modelo chegam a bilhões e trilhões, essas pequenas rugas equivalem a enormes ondas de choque ao longo do ciclo de treinamento.

Ampliação, expansão e expansão são o centro das atenções na OFC
Kannan Raj falando no painel de discussão “Estado da Indústria: Agora e em 2031” na OFC em Los Angeles

Um ponto de inflexão semelhante ao da IA ​​foi testemunhado há algum tempo, quando aplicações como streaming de vídeo, entrega de conteúdo e serviços em nuvem ganharam destaque, levando as empresas a fazer atualizações incrementais em suas redes para suportar maior largura de banda e menores requisitos de latência. Mais uma vez, as cargas de trabalho de IA exigem uma mudança – só que, desta vez, é necessária uma redefinição elementary.

Amplie, expanda e atravesse

Hyperscalers, neoscalers e provedores de serviços estão todos buscando três tipos de conectividade dentro e entre information facilities para disponibilizar recursos para cargas de trabalho de IA: escalabilidade vertical, escalabilidade horizontal e escalabilidade transversal.

O aumento de escala refere-se à conexão de um grande número de GPUs nos mesmos clusters de computação. Adicionar novos recursos ao sistema existente ou mover as cargas de trabalho para um sistema mais robusto atende às cargas de trabalho com os recursos extras de que precisam. Por estar pronto para uso, o escalonamento oferece algumas vantagens exclusivas, incluindo latência ultrabaixa e conectividade sem perdas.

A expansão é um avanço em relação ao modelo de expansão. Aqui, os clusters são conectados em vários racks para obter paralelismo agrupando máquinas. Uma opção preferida para muitos aplicativos que exigem muitos recursos, pois proporciona melhor desempenho ao quebrar as limitações físicas de servidores e chassis. Por outro lado, a comunicação agora depende mais da rede, o que significa que a estrutura precisa ter degradações mínimas, já que as cargas de trabalho de IA são intolerantes a quedas de desempenho.

A expansão empurra as cargas de trabalho para fora dos information facilities. Envolve interconectar vários information facilities abrangendo regiões geográficas para criar o que hoje é chamado de “fábricas de IA”. Esse cluster de information facilities em escala gigantesca funciona como uma unidade lógica única com milhares de GPUs interconectadas que se comunicam entre campus e regiões.

“A expansão é altamente localizada”, explicou Raj. “É síncrono, tipo de passagem de mensagens, baixa latência… A expansão está basicamente dentro do pod. Portanto, é adequada para executar inferência. A escala pode variar (dependendo) de com quem você fala. Pode ser de 10 quilômetros a milhares de quilômetros.”

Essas arquiteturas definem a estrutura central da rede na period da IA.

Soluções ópticas e interconexões permitindo arquiteturas de rede modernas

Para tornar possíveis essas novas arquiteturas, são necessárias tecnologias ópticas mais recentes e interconexões de maior calibre para fornecer conectividade de alta densidade, baixa latência e longo alcance. É aqui que entram em discussão tecnologias como conectáveis ​​lineares, óptica coerente, óptica co-embalada e cabines de amplificadores multitrilho.

No transporte óptico de alta capacidade, 400G, 800G, 1.6T e além oferecem alta eficiência espectral, suporte para distâncias mais longas e formatos de baixo consumo de energia e espaço eficiente.

“A expansão hoje é principalmente…cobre e está chegando a um ponto em que haverá essencialmente algum híbrido óptico-cobre, e depois a transição para óptico também. Mas a expansão é um hyperlink DR (Direct Attain) ou um hyperlink FR (Far Attain) e é aí que os conectáveis ​​desempenham um papel importante”, disse Raj.

“O tipo de óptica usada para escala pode abranger uma ampla gama”, acrescentou. “Pode ser óptica FR, pode ser luz coerente ou pode ser óptica ZR (Prolonged Attain). Portanto, a escala tem mais considerações de implantação.”

No entanto, Raj destacou que a distinção entre as arquiteturas está gradualmente desaparecendo, tornando a resiliência o fator ultimate. “A distinção entre expansão e expansão está um pouco confusa. E, novamente, em tudo isso, queremos ter certeza de que há resiliência… vários racks constituem uma rede de expansão neste momento.”

Além disso, Raj falou sobre estruturas de rede multiplanares que estão se tornando cada vez mais importantes para a construção de clusters de IA em escala ultralarga. Essa arquitetura de rede mescla vários tecidos Clos independentes em um só, suportando clusters de IA em grande escala.

“Multi-planar é na verdade uma topologia mais plana, RADIX maior. Ainda é um Clos de duas camadas… Cada GPU está basicamente se comunicando com todas as outras GPUs… é uma forma de dividir e conquistar os recursos disponíveis, mas basicamente nos permite expandir a rede para criar um domínio maior aqui”, observou ele.

“RDMA (Acesso Remoto Direto à Memória), ao contrário do TCP, é muito implacável quando se trata do desempenho da rede. Portanto, temos que garantir que haja interoperabilidade robusta. Temos muitos problemas relacionados a flaps de hyperlink e assim por diante. Existem flaps de hyperlink determinísticos (e) flaps de hyperlink não determinísticos. Portanto, a indústria tem que prestar atenção em como eliminar esses tipos de problemas”, disse ele.

Deixe um comentário

O seu endereço de e-mail não será publicado. Campos obrigatórios são marcados com *