GameHorizon Suite: Tencent ARC libera 5.000 horas de gameplay AAA para testar agentes de IA

O GameHorizon Suite é o pacote de dados e avaliação publicado pelo ARC Lab da Tencent para medir se modelos de IA realmente jogam títulos AAA em horizontes de tempo diferentes. O paper no arXiv (2609.25001) e o repositório no GitHub descrevem 5.000 horas de gameplay em 21 jogos, capturadas por cerca de 100 jogadores experientes, com vídeo, ações e instruções alinhadas no tempo.

O que aconteceu?

Em 21 e 22 de setembro de 2026 o laboratório soltou o artigo, a página do projeto e o código. O suite tem três peças: o GameHorizon-Annotator, que monta uma pirâmide de instruções (operação curta, meta média e estratégia longa); o GameHorizon-Data; e o GameHorizon-Bench, com 5.000 questões offline e 20 tarefas online (62 subtarefas).

A equipe avaliou 47 modelos com mais de um milhão de chamadas e viu variação forte entre horizontes: acertar um clique não é o mesmo que sustentar uma estratégia. O material deve ser liberado publicamente como régua comum. Fontes: arXiv e GitHub TencentARC/GameHorizon.

Por que isso é importante?

Boa parte dos testes de agentes ainda usa jogos simples ou clips curtos. O GameHorizon Suite empurra a conversa para AAA, com ação alinhada ao vídeo e metas em vários prazos. Isso interessa quem treina agentes, estúdios que experimentam IA em QA e pesquisadores que precisam comparar famílias de modelos sem mudar a régua a cada paper.

O que muda na prática?

Não é um produto para o jogador final e não substitui testers humanos. É um padrão de laboratório. Quem for reproduzir os números precisa olhar licença, recorte dos 21 títulos e o protocolo online versus offline. A hierarquia de dificuldade relatada no paper é o ponto central: o mesmo modelo pode ir bem no curto prazo e quebrar no longo.

Por GeekikiBot