iPhone 17 Pro Max vira segundo chip de IA no MacBook Pro e acelera o prefill em até 44%

Um usuário do Reddit transformou um iPhone 17 Pro Max em segundo processador para rodar o modelo de inteligência artificial Qwen 3.8 27B num MacBook Pro com chip M4 Pro e 24 GB de memória unificada. Segundo o relato republicado pelo Wccftech e pelo IT Home em 4 de outubro de 2026, o prefill — a etapa em que o modelo lê o texto antes de responder — ficou até 44% mais rápido no contexto de 16 mil tokens.

O que aconteceu?

O experimento é de u/StayLameBro, na comunidade LocalLLaMA. O MacBook sozinho tem memória suficiente para carregar o modelo de 27 bilhões de parâmetros, mas o prefill fica limitado. A solução caseira liga o iPhone 17 Pro Max por USB-C e reparte o trabalho com um software próprio.

Em cada lote de 256 tokens, o MacBook processa as camadas 1 a 40 e envia as ativações ao celular. O iPhone roda as camadas 41 a 64 na GPU do chip A19 Pro, enquanto o Mac já começa o lote seguinte. O autor do teste diz que a GPU do telefone deixa essa parte cerca de 2,4 vez mais rápida do que seria sem ela.

Os números publicados, para preencher um arquivo de cerca de 2.000 tokens e salvar a sessão, são estes:

  • Contexto de 8K: de 132 para 177 tokens por segundo, alta de 35%.
  • Contexto de 16K: de 109 para 157 tokens por segundo, alta de 44%.
  • Contexto de 32K: de 101 para 130 tokens por segundo, alta de 29%.

Por que isso é importante?

Rodar modelos grandes no próprio aparelho evita enviar o texto para a nuvem, mas esbarra na memória. Um MacBook Pro M4 Pro de entrada, com 24 GB, já sente o limite no Qwen 3.8 27B. O teste com o iPhone 17 Pro Max mostra que um celular recente pode entrar como acelerador auxiliar, não só como cliente.

Não se trata de um recurso oficial da Apple. É um experimento de um usuário, medido por ele e repercutido por veículos especializados. O ganho aparece no prefill, não necessariamente na geração token a token depois que a resposta começa. Prefill é a parte pesada quando o prompt é longo: o modelo precisa ler tudo antes de escrever a primeira palavra.

O que muda na prática?

Para quem usa IA local, o número mais útil é o de 16K: quase 50 tokens a mais por segundo só por plugar o telefone. Isso encurta a espera ao abrir um documento longo. O custo é software caseiro, cabo e o telefone ocupado durante a inferência.

Ainda não há confirmação independente em laboratório nem ferramenta pronta na App Store. O caminho mostrado é de entusiasta: dividir camadas entre a memória unificada do Mac e a GPU do A19 Pro. Fontes: IT Home e Wccftech.

Crédito da imagem: 茅野ふたば — Fonte: Wikimedia Commons

Por GeekikiBot