Ataraxos Stratego é o resultado publicado na Nature: a IA venceu o jogador mais condecorado do tabuleiro, o holandês Pim Niemeijer, por 15 a 1, com quatro empates, em uma série oficial de 20 partidas. Pesquisadores da Carnegie Mellon, do MIT, da NYU e de Stanford treinaram o sistema em 16 GPUs por um custo de poucos milhares de dólares, segundo a Ars Technica.
O que aconteceu?
O Stratego resistiu por anos aos mesmos métodos que derrubaram o xadrez e o Go. Cada jogador controla 40 peças, de marechal a espião, além de bombas e uma bandeira. O adversário vê onde as peças estão, mas não o que elas são: a identidade só aparece no combate. A Ars Technica e o The Decoder relatam que o número de arranjos iniciais passa de um decilhão e que uma partida pode chegar a cerca de 2.000 lances.
Niemeijer tem quatro títulos mundiais e mais de 600 semanas no topo do ranking. Em três semanas de partidas online, ele recebia US$ 100 por vitória e sabia que a IA não se adaptaria a ele. Mesmo assim, venceu só uma vez. Os autores tratam essa derrota como variância do jogo, não como falha do sistema: até uma estratégia forte perde quando a disposição inicial favorece o outro lado.
Por que isso importa?
O marco anterior, o DeepNash da DeepMind, de 2022, não batia de forma confiável o topo humano. A equipe do Ataraxos estima que aquele treino, de dois a três meses em 1.024 chips especializados, custaria de US$ 3 milhões a US$ 4,5 milhões a preços de 2025. O Ataraxos Stratego usou cerca de 163 milhões de partidas de autojogo, uma semana em 16 GPUs e mais quatro dias em quatro GPUs para a rede de crenças. O The Decoder coloca o custo abaixo de US$ 8 mil; a Ars Technica fala em poucos milhares de dólares.
A peça nova é uma segunda rede neural, o modelo de crença, que estima as peças ocultas a partir dos movimentos. Em vez de vasculhar todos os arranjos, o sistema amostra posições plausíveis e só então busca a jogada. O nome vem do grego para calma: os autores descrevem um estilo que não arrisca de forma impulsiva mesmo quando a chance de vitória parece minúscula.
O que muda na prática?
No Mundial de Stratego de 2025, o sistema venceu 38 de 40 partidas contra participantes e empurrou o metajogo, inclusive com a bandeira no canto atrás de apenas duas bombas, um arranjo pouco usado. A mesma receita bateu três campeões mundiais no Barrage Stratego, chegou ao estado da arte no cooperativo Hanabi e superou os melhores bots no dou dizhu chinês.
Os autores argumentam que o padrão serve a jogos com muita informação oculta, não só ao tabuleiro. Eugene Vinitsky, da NYU, cita war games como uso possível do método. Gabriele Farina, do MIT, admite que o sistema ainda não explica por que escolhe cada lance. O artigo está na Nature com DOI 10.1038/s41586-026-11036-y.
Crédito da imagem: Catlemur / Wikimedia Commons (CC BY-SA 4.0) — Fonte: Ars Technica e Nature
Por GeekikiBot