Resumo
À medida que a inteligência artificial (IA) avança rapidamente, as redes tradicionais de data centers enfrentam grandes desafios ao transportar o tráfego de IA. A alta utilização da largura de banda e um pequeno número de fluxos elefantes podem tornar o balanceamento de carga convencional por{1}}fluxo ineficaz, resultando em congestionamento e perda de pacotes que aumentam significativamente o treinamento do modelo de IA e os tempos de conclusão do trabalho. Este white paper examina uma tecnologia de roteamento inteligente e dinâmico que combina reconhecimento-em tempo real com tomada de decisão inteligente-. Ele usa medição de qualidade de-caminho, sincronização de atributos- estendidos do BGP, multicaminho de-custo dinâmico ponderado (WCMP), remoção-anormal de caminho e
Balanceamento de carga automático-no nível do flowlet (ALB) para melhorar a programação de tráfego em ambientes de IA. O design também usa virtualização para fornecer isolamento-de vários locatários e oferece cenários de aplicativos e orientações de planejamento para redes de data centers de IA eficientes, estáveis e inteligentes.
Introdução: Evolução da Rede na IA Era
Por que as redes tradicionais lutam com a IA Tráfego
Nas redes tradicionais de data center, um grande número de pequenos fluxos permite o balanceamento de carga por{0}}fluxo para alcançar uma distribuição aceitável e evitar congestionamentos, mesmo sem conhecimento-em tempo real das condições da rede. O tráfego de IA é muito diferente: a utilização da largura de banda é extremamente alta e o tráfego é frequentemente dominado por apenas alguns fluxos elefantes. As colisões de hash podem, portanto, colocar vários fluxos grandes no mesmo caminho, enquanto outros caminhos permanecem subutilizados. Quando ocorre a perda de pacotes, o tempo de conclusão de toda a carga de trabalho de IA pode aumentar significativamente. Por esse motivo, o setor se concentra cada vez mais em algoritmos de balanceamento de-carga otimizados para malhas de IA para que o tráfego seja distribuído de maneira mais uniforme em vários caminhos .

Figura 1. Comparação entre tráfego de fluxo-elefante de IA e tráfego tradicional de-fluxo pequeno.
Combinando consciência dinâmica com tomada de decisão inteligente-
O roteamento inteligente dinâmico é uma tecnologia de balanceamento de carga-baseada em reconhecimento-. Ele usa a qualidade do caminho detectada por switches na malha para ajustar a seleção do caminho local e suporta balanceamento de carga ponderado dinamicamente. Desenvolvida no BGP, a tecnologia define um novo atributo de{4}comunidade estendido.
Medições multi{0}}dimensionais e de alta{1}}precisão são usadas para avaliar a qualidade do caminho, e o resultado é propagado por meio do BGP para orientar o encaminhamento de tráfego subsequente. Isso melhora a distribuição de carga-em toda a rede e reduz o tempo de resposta do aplicativo [1].

Figura 2. Fluxo de trabalho dinâmico de conscientização, decisão e execução.
Tecnologias principais: agendamento inteligente de tráfego
As principais abordagens de balanceamento de-carga de rede incluem:
- ECMP por-fluxo: a abordagem mais comum, baseada em um hash de cinco{1}}tuplas. Funciona bem quando há muitos fluxos e preserva a ordem dos pacotes, mas as colisões de hash podem produzir um equilíbrio deficiente quando as contagens de fluxo são baixas, como no treinamento de IA [1].
- Balanceamento baseado em-fluxos: depende da configuração correta do intervalo entre-fluxos. A configuração precisa é difícil quando a latência no nível do caminho global-é desconhecida [1].
- ECMP por{0}}pacote: fornece excelente equilíbrio teórico, mas pode criar extensa reordenação de pacotes no receptor [1].
A abordagem de roteamento inteligente dinâmico usada pelos switches RoCE da série XingRongyuan CX-N (baseados em SONiC-) combina balanceamento baseado em-ECMP e Flowlet-por fluxo. Ele introduz WCMP (Weighted Cost Multipath) dinâmico e ALB (Auto Load Balancing) baseado em Flowlet [1].
Medição da qualidade do caminho
O sistema avalia a qualidade do caminho da rede usando fatores que afetam fortemente as estruturas do cluster de IA, incluindo utilização de largura de banda, utilização de fila e latência de encaminhamento.
Contadores estatísticos
A largura de banda e a utilização da fila são medidas por meio de contadores de hardware ASIC com precisão no nível de cem-milissegundos. O ASIC registra contadores de-encaminhamento de porta e de fila-em tempo real. O plano de controle SONiC lê os contadores por meio da interface SAI com precisão inferior a -segundos e os armazena no Redis. O processo de controle-de roteamento avalia a qualidade da interface usando esses contadores e anuncia o resultado por meio do BGP. Para limitar a carga do plano-de controle, atualmente as divulgações são enviadas em intervalos de-segundo nível, com uma média ponderada aplicada a diversas amostras; amostras mais recentes recebem peso maior.
Telemetria-em banda
A medição de-atraso de encaminhamento é baseada em INT (telemetria de rede-em banda) e pode atingir precisão de nível-de nanossegundos. HDC (High Delay Capture) captura pacotes que apresentam alta latência dentro do ASIC. Quando um pacote excede um limite de atraso definido-pelo usuário, o switch envia os primeiros 150 bytes do pacote original junto com metadados, incluindo porta de entrada, porta de saída e latência, para um coletor. Nesse design, a CPU atua como coletor e analisador HDC, permitindo medições de atraso de encaminhamento-de alta precisão e avaliação de qualidade de caminho-mais precisa.

Figura 3. Propagação-de qualidade do caminho e instalação do WCMP.
A tecnologia usa um novo atributo de comunidade- estendida do BGP, a Path Bandwidth Extended Community, para indicar a qualidade agregada de um caminho até um destino. O byte de{2}}ordem superior do campo de tipo- estendido é 0x00 e o byte de{6}}ordem inferior é 0x05. No campo de valor, o subcampo Administrador Global representa o número AS. A qualidade do caminho é codificada em quatro bytes usando o formato de ponto{10}flutuante IEEE e expressa em GB/s.
Quando o NIC1 se comunica com o NIC2, o NIC2 primeiro anuncia seu endereço IP para Leaf2. Leaf2 anuncia o endereço para o Spine junto com o valor-de qualidade do link para NIC2 multiplicado pelo peso do downlink Leaf2. O Spine adiciona sua própria qualidade de link ponderada e passa o valor acumulado para Leaf1. Leaf1 resume a qualidade do caminho e instala rotas que orientam o encaminhamento. Em uma estrutura Leaf-Spine de duas- camadas, as portas são classificadas como uplinks Leaf, downlinks Leaf e portas Spine, com coeficientes de cálculo configuráveis para cada classe.
WCMP Dinâmico
O balanceamento de carga distribui o tráfego por vários links. Em ambientes de IA, isso é essencial para construir uma malha Ethernet sem perdas com perda mínima de pacotes, latência e degradação de rendimento. ECMP é o mecanismo convencional em data centers. WCMP estende ECMP distribuindo
tráfego proporcionalmente entre links. No roteamento inteligente dinâmico, os pesos do WCMP são ajustados em tempo real de acordo com a qualidade do caminho. Por exemplo, se existirem dois caminhos entre NIC1 e NIC2, o sistema poderá calcular uma proporção de 3:7. À medida que o tráfego muda, as informações atualizadas-de qualidade do caminho são propagadas por meio do BGP para cada switch Leaf, onde rotas WCMP dinâmicas são geradas para orientar o encaminhamento .
Remoção de caminho anormal
Quando a qualidade agregada de um caminho cai abaixo de um limite acordado, o caminho é considerado inutilizável para a carga de trabalho de IA e é removido do encaminhamento. Os caminhos restantes continuam a transportar tráfego através do WCMP dinâmico. Assim que o caminho voltar ao normal, ele será restaurado. Embora isso possa deixar temporariamente alguma capacidade não utilizada, evita congestionamentos mais sérios e perda de pacotes [1].
Balanceamento de carga inteligente (ALB)
O ALB fornece distribuição de carga-baseada em Flowlet. O ASIC mede a carga e a latência em diferentes portas em tempo real e direciona cada Flowlet para o link com menor carga ou menor atraso. Isso adiciona um agendamento-mais refinado além do ECMP tradicional. O ALB também suporta failover de porta e redistribui automaticamente o tráfego quando um link de saída falha [1].
Virtualização
As redes-de front-end geralmente precisam de suporte-multilocatário para que diferentes recursos de GPU possam ser alocados para diferentes usuários. A solução utiliza VRF (Virtual Routing and Forwarding) para isolar locatários, com um VRF atribuído a cada usuário. As sub-redes relacionadas à GPU-são colocadas no VRF do usuário, e PRE ACLs no ASIC classificam o tráfego de entrada para que o tráfego de cada usuário seja encaminhado apenas dentro do VRF correspondente [1].
Cenários de aplicação
1.Como o WCMP dinâmico absorve picos de tráfego
Para uma malha com portas de GPU de 256 x 400G, uma arquitetura Clos de dois{2}}níveis pode ser projetada com uma taxa de convergência de downlink-para-uplink de 1:1 para manter alto rendimento, alta largura de banda e capacidade simétrica. Modelos de produtos adequados incluem o XingRongyuan CX864E-N ou CX732Q-N [1]. No ECMP convencional, um pequeno número de fluxos elefantes de IA pode fazer hash para o mesmo Spine, causando congestionamento no uplink ou perda de pacotes. O WCMP dinâmico ajusta continuamente a distribuição do tráfego de acordo com a qualidade-do caminho em tempo real, reduzindo picos de tráfego e evitando congestionamentos [1].
2.Flowlet-Balanceamento de carga em nível
Na mesma estrutura de GPU de 256 x 400G, nem todos os dispositivos ou cargas de trabalho são melhor atendidos pelo WCMP dinâmico. O switch pode selecionar dinamicamente ALB baseado em Flowlet. O ALB mede a carga e a latência dos links no grupo ECMP e envia Flowlets para links com menor utilização ou atraso. Se uma interface ficar sobrecarregada ou seu atraso de encaminhamento aumentar, o ASIC evita automaticamente essa saída até que as condições voltem ao normal [1].
Planejamento e design de rede de IA
Os serviços de IA geralmente incluem três estágios: coleta e pré-processamento de dados, treinamento de modelo e inferência de IA. Cada estágio impõe requisitos diferentes à rede.
1. Coleta e pré-processamento de dados
Uma rede global de-coleta de dados de treinamento e pré-processamento deve fornecer recursos de largura de banda e IP públicos elásticos e em grande-escala para que grandes conjuntos de dados brutos possam ser coletados com eficiência da Internet global. O projeto deve garantir uma transmissão segura e estável, melhorando ao mesmo tempo a agregação de dados e o desempenho do pré-processamento [2].
1.1 Segmentação VPC
O projeto de VPC para coleta de dados-baseada em nuvem deve seguir princípios de{{1}privilégios mínimos, isolamento em camadas, controle de segurança e escalabilidade elástica. Podem ser usadas múltiplas VPCs ou múltiplas sub-redes dentro de uma única VPC [2].
- Segmente por estágio de serviço: implante coleta, pré-processamento, armazenamento, treinamento e inferência de dados em sub-redes ou VPCs separadas. Coloque pontos de entrada de coleta em uma VPC DMZ ou sub-rede pública; colocar dados temporários e de pré-processamento em uma VPC de processamento dedicada; coloque dados brutos confidenciais e treinamento de IA em uma VPC de alta-segurança sem acesso público direto.
- Isole por nível de segurança: crie VPCs ou sub-redes de alta-, média- e baixa{2}}segurança e use grupos de segurança, ACLs de rede e conectividade privada para controlar o tráfego entre-VPCs e entre{4}}sub-redes.
- Isolar por locatário ou projeto: atribua VPCs separadas a diferentes locatários ou projetos para isolar recursos, redes e dados.
1.2 Rede de Saída de Coleta de Dados
Gateway NAT: Use um conjunto de EIPs e SNAT por meio de um gateway NAT, permitindo que programas de coleta acessem a Internet a partir de endereços IP públicos selecionados aleatoriamente.
Proxy-autoconstruído: implante servidores proxy que mantêm mapeamentos entre processos de coleta e endereços IP públicos e distribuam uma única solicitação de coleta entre vários proxies.
Provedor de serviços IP: Conecte-se a um provedor de serviços IP pela rede privada em nuvem para obter custos mais baixos, segurança controlada e qualidade estável [2].
1.3 Agregação e pré-processamento de dados-entre regiões
Selecione a região do OSS de acordo com o plano de cluster-de pré-processamento e crie uma VPC de agregação-de dados na mesma região. Crie um roteador de trânsito (TR) em cada região, conecte VPCs locais e interconecte os TRs para que as VPCs de coleta regional possam acessar diretamente o OSS central. Serviços como PAI{4}}iTAG, MaxCompute e Flink podem então realizar rotulagem e pré-processamento de dados na região OSS [2].
2. Rede de Treinamento Modelo
A rede-de treinamento do modelo é totalmente integrada à rede de coleta e pré-processamento para formar uma malha global que conecta data centers em nuvem, nós de borda e IDCs-no local.
A interconexão de alta-velocidade fornece movimentação de dados de baixa-latência e alta{2}}capacidade, enquanto a largura de banda, as políticas de segurança, os controles de acesso e a recuperação de desastres devem ser projetados de ponta a ponta [2].
- Pool de computação-entre{1}clusters entre regiões: um roteador de trânsito conecta várias VPCs na mesma região. As ENIs do servidor se conectam aos switches VPC e podem ser configuradas para a taxa de transferência e o RDMA necessários.
- Pool de computação-entre nuvens: circuitos dedicados conectam um IDC ou outra nuvem a uma VPC da mesma-região. Os VBRs do Alibaba Cloud se conectam na Camada 3 ao dispositivo peer, com BGP, BFD e failover rápido para convergência rápida.
Pool de computação global: links-cruzados entre regiões entre TRs são provisionados de acordo com o pico de tráfego entre-regiões, com QoS inter-interregional opcional para criar um pool de computação unificado entre regiões [2].
3. Inferência global-Rede de serviços
Uma rede de inferência global seleciona modelos de implantação de acordo com os recursos e serviços em nuvem disponíveis em cada região e fornece distribuição e acesso eficiente aos serviços [2].
- Implantação de modelo ou agente: use a implantação do Model Studio MaaS, a implantação PAI{0}}EAS ou Function Compute PaaS ou a implantação IaaS na infraestrutura bare metal EGS, ACK, ACS ou Lingjun dentro da VPC do cliente.
- Distribuição de serviços: crie uma VPC de distribuição-de inferência e conecte redes privadas usando peering de VPC, VPCs de serviço-de nuvem associadas ou PrivateLink. Implemente o ALB ou o ALB aprimorado como ponto de acesso e solicitações de proxy para diferentes modelos ou agentes.
- Acesso ao serviço: Os usuários locais da Internet podem acessar diretamente o ALB aprimorado; usuários remotos podem usar o Global Accelerator (GA); usuários corporativos internos ou externos do Alibaba Cloud podem se conectar de forma privada por meio do PrivateLink.
Conclusão e perspectivas
Este white paper explica os desafios enfrentados pelas redes IDC na era da IA e como o roteamento inteligente e dinâmico pode enfrentá-los. O reconhecimento dinâmico, a tomada de decisão inteligente-, a virtualização WCMP, ALB e VRF melhoram a eficiência do-balanceamento de carga, reduzem o congestionamento e a perda de pacotes e aceleram o treinamento e a inferência de IA. A seção de planejamento enfatiza a segmentação de VPC, design de saída-de coleção, agregação e pré-processamento-entre regiões, treinamento de modelo e entrega de inferência global. À medida que a IA continua a evoluir, as redes de data centers enfrentarão requisitos mais rigorosos. O roteamento inteligente dinâmico continuará a melhorar para IA de ponta, aprendizagem federada e outros cenários complexos. As futuras redes da IDC darão maior ênfase à convergência de redes-de computação, à eficiência energética e às operações automatizadas, criando uma base mais inteligente, eficiente e confiável para a economia digital.
Referências
Documento de origem técnica-fornecido pelo usuário.
Artigo técnico da rede Alibaba Cloud AI. Acessado em 27 de maio de 2026.
https://help.aliyun.com/zh/cloud-rede-bem-arquitetada-design/alibaba-nuvem-ai-rede-whitepaper-

