A DeepSeek e a Huawei alargaram a colaboração no desenvolvimento de software para inteligência artificial, com novas ferramentas de código aberto destinadas aos aceleradores Ascend 950. O trabalho abrange bibliotecas de computação e comunicação, além da adaptação da linguagem TileLang à arquitetura da fabricante chinesa.

A iniciativa não representa o início de uma alternativa chinesa ao CUDA. A Huawei já desenvolve o CANN como plataforma de software para os seus processadores e o TileLang já suportava outras arquiteturas. A novidade está na disponibilização de componentes usados pela DeepSeek para cargas de IA e na otimização conjunta deste software para a nova geração Ascend.
Segundo a Reuters, a colaboração inclui ferramentas destinadas a reduzir a dependência do ecossistema da Nvidia. Entre os projetos agora disponíveis encontram-se versões para Ascend de bibliotecas como DeepGEMM e DeepEP, utilizadas respetivamente em operações matemáticas e na comunicação entre aceleradores.
Software torna-se uma peça central da estratégia Ascend
A capacidade de um acelerador executar um modelo de IA não depende apenas do desempenho do processador. Bibliotecas, compiladores, ferramentas de desenvolvimento e suporte aos principais frameworks determinam quanto trabalho é necessário para transferir uma aplicação de uma plataforma para outra.
É precisamente neste ponto que a Nvidia mantém uma vantagem acumulada através do CUDA e das bibliotecas construídas à sua volta. Uma infraestrutura de software madura permite aos programadores aproveitar hardware novo sem reescrever partes substanciais das aplicações.
A DeepSeek procura reduzir essa diferença através de ferramentas que já utiliza no desenvolvimento dos seus modelos. O DeepGEMM Ascend, publicado a 30 de setembro, mantém as interfaces da versão original do DeepGEMM e suporta operações em BF16, FP8 e FP4 no Ascend 950. A equipa afirma ter atingido até 99,8% do limite teórico do hardware em determinados testes de multiplicação de matrizes. Estes resultados foram produzidos pelos próprios responsáveis pelo projeto e não constituem uma comparação independente com CUDA ou processadores Nvidia.
O DeepEP-Ascend desempenha outra função. A biblioteca trata da comunicação entre aceleradores durante o treino e a inferência de modelos Mixture-of-Experts, nos quais diferentes partes do modelo podem estar distribuídas por vários processadores. As interfaces públicas foram alinhadas com a versão destinada a GPUs Nvidia, uma abordagem que pode reduzir alterações no código quando uma aplicação passa para Ascend.
TileLang ganha suporte nativo para Ascend 950
Outra peça da estratégia é o TileLang, uma linguagem de domínio específico destinada à criação de kernels de alto desempenho. O projeto utiliza uma sintaxe próxima de Python e procura esconder parte da complexidade da programação de baixo nível.
A atualização publicada a 30 de setembro acrescentou suporte oficial ao Ascend 950, com geração nativa de código, escalonamento automático, sincronização e programação vetorial. O projeto já suporta CUDA, ROCm, Apple Metal e outras plataformas, pelo que não funciona apenas como uma alternativa ao CUDA, mas como uma camada de programação capaz de trabalhar com diferentes arquiteturas.
A DeepSeek apresenta esta abordagem como uma forma de simplificar a programação dos aceleradores sem abdicar do acesso ao desempenho do hardware. Existem resultados publicados pelo próprio projeto que mostram desempenho próximo de implementações escritas diretamente em Ascend C em algumas operações, mas esses números não permitem concluir que TileLang e CUDA sejam equivalentes em aplicações completas.
DeepSeek e Huawei testam sistema com 128 Ascend 950
A colaboração também chegou ao hardware. DeepSeek e Huawei trabalharam numa configuração que reúne 128 aceleradores Ascend 950 num único sistema de grande dimensão, com otimizações de computação e comunicação entre os processadores.
Esta escala é particularmente relevante para modelos Mixture-of-Experts. Distribuir centenas de especialistas por vários aceleradores exige não apenas capacidade de cálculo, mas também elevada largura de banda e software capaz de movimentar dados sem criar estrangulamentos.
Os resultados publicados no DeepEP-Ascend mostram testes até 128 processadores. A documentação reconhece, contudo, que algumas funções continuam em desenvolvimento e que determinadas operações de comunicação ainda não estão implementadas. O projeto também utiliza atualmente uma configuração de hardware e firmware específica fornecida à DeepSeek, enquanto a versão comercial recomendada pela Huawei tem disponibilização prevista para outubro.
CUDA continua a ter uma vantagem de maturidade
Abrir bibliotecas e aproximar as interfaces utilizadas nos dois ecossistemas pode reduzir o esforço necessário para utilizar os Ascend, mas não elimina de imediato a diferença de maturidade entre as plataformas.
Um estudo publicado em julho sobre a execução de grandes modelos num sistema com 16 aceleradores Huawei Ascend 910 identificou limitações no suporte a operadores, estabilidade de funcionalidades avançadas, compilação de grafos, escalabilidade e ferramentas de diagnóstico. Os investigadores tiveram de aplicar alterações ao software e desativar algumas funcionalidades para garantir resultados corretos. O estudo analisou uma geração anterior de hardware e software, pelo que as conclusões não podem ser transferidas diretamente para o Ascend 950. Ainda assim, ilustram o tipo de dificuldades que um ecossistema alternativo ao CUDA precisa de resolver.
A estratégia da DeepSeek e da Huawei procura atacar precisamente essa camada. Em vez de competir apenas através de processadores, as empresas tentam construir ferramentas que permitam desenvolver, otimizar e distribuir modelos sem depender da infraestrutura de programação da Nvidia.
O resultado ainda não é um substituto demonstrado para todo o ecossistema CUDA. É, porém, um passo adicional na construção de uma plataforma Ascend mais completa, com ferramentas de código aberto que podem ser testadas, modificadas e integradas por outros programadores.
Outros artigos interessantes:




