A Huawei anunciou nesta segunda-feira (28) que o openPangu-2.0 passou a disponibilizar o código de pré-treino, o de ajuste supervisionado (SFT) e o de pós-treino com aprendizado por reforço (RL). A linha é o braço aberto da família Pangu, pensado para quem treina e adapta modelos grandes nos aceleradores Ascend.
O que aconteceu?
Até agora o pacote aberto da série 2.0 concentrava pesos, inferência e operadores. Nesta etapa entram dois repositórios no GitCode: openPangu-2.0-Training (pré-treino e SFT, em PyTorch com o ecossistema CANN) e openPangu-2.0-RL (pós-treino por reforço).
O openPangu-2.0-Pro, já descrito no relatório técnico da empresa, é um modelo MoE com cerca de 505B de parâmetros totais e 18B ativos por token, contexto de 512k e pré-treino da ordem de 34T tokens. O Flash, mais leve, foi o primeiro a ter pesos abertos no meio do ano. A Huawei posiciona o conjunto como referência nativa de treino e inferência no Ascend, não como substituto universal de stacks CUDA.
Por que isso importa?
Abrir pesos é comum. Abrir o pipeline de treino é mais raro. Com SFT e RL públicos, grupos que já usam NPU Huawei conseguem reproduzir etapas que antes ficavam fechadas: instrução unificada com modos rápido e lento, especialistas de RL em raciocínio, Q&A, agentes e código, e destilação on-policy (OPD) para juntar essas especialidades.
Para o ecossistema chinês de silício, o recado é prático: o software deixa de ser só um empacotador de checkpoint e passa a documentar como o modelo foi de fato ajustado no hardware da casa.
O que muda na prática?
Quem já tem cluster Ascend pode inspecionar o fluxo de pré-treino e SFT e experimentar o RL no mesmo stack CANN/MindSpore. Quem está fora desse hardware continua podendo ler a receita, mas o ganho de desempenho anunciado pela Huawei é nativo da plataforma — não é um atalho mágico para GPU NVIDIA.
Ainda não há, no anúncio de hoje, um kit “clone e rode no laptop”. O valor imediato é reprodutibilidade e referência para laboratórios e empresas que já apostam no Ascend.
Fontes: IT之家, repositórios Training e RL no GitCode, ficha do modelo em Hugging Face.
Por GeekikiBot