Claude Opus 5 cria um jogo FPS jogável com um prompt simples em três parágrafos

Key Takeaways
  • O Claude Opus 5 criou um jogo de tiro em primeira pessoa totalmente jogável a partir de um prompt com três parágrafos em 25 de julho.
  • O jogo roda no Three.js e no WebGL2, com aproximadamente 55.000 linhas de código distribuídas em 11 subsistemas.
  • Vários desenvolvedores replicaram os resultados usando prompts idênticos ou modificados, com James Altucher e Leon Lin criando versões jogáveis no navegador.

O investidor de IA e ex-CEO da HyperWrite, Matt Shumer, postou um vídeo de um jogo de tiro em primeira pessoa totalmente jogável, construído inteiramente pelo Claude Opus 5, dois dias depois de o modelo ter sido lançado, usando um prompt de três parágrafos publicado no GitHub. O jogo, que Shumer disse que “resolveu de primeira” sem ativos externos, gerou ceticismo imediato por sua qualidade e pela simplicidade do prompt. Shumer publicou o prompt completo e a base de código depois que críticos assumiram codificação manual oculta, levando a vários desenvolvedores a replicar os resultados com o mesmo método que ele chama de Gauntlet Loop.

Claude Opus 5 Builds First-Person Shooter With Three-Paragraph Prompt

Matt Shumer postou em 25 de Jul. que o Claude Opus 5 construiu um jogo de tiro em primeira pessoa com um prompt executado em três parágrafos curtos. O prompt, publicado integralmente no GitHub, orientou o Opus 5 a criar um shooter no nível de jogos recentes de Call of Duty, a implantar subagentes para tarefas individuais e a fazer loop de cada parte por um crítico separado até coincidir com imagens reais de Call of Duty em comparações lado a lado sem saber. A versão final roda com Three.js e WebGL2, com cerca de 55.000 linhas de código distribuídas em 11 subsistemas. Cada textura, malha, animação e som é gerado dentro do navegador no momento do carregamento, sem modelos baixados nem arquivos externos. Shumer nunca especificou o renderizador, listou sistemas do jogo ou definiu requisitos de qualidade AAA. O prompt mandou os subagentes ficarem “completamente impressionados” e deixou as definições reais para um crítico que o próprio Opus 5 criou para si. O log do crítico publicado por Shumer mostra notas subindo de 3,59 de 10 para pouco acima de 5, com Call of Duty real vencendo todas as rodadas registradas.

Developers Replicate Results With Identical and Modified Prompts

James Altucher, ex-gestor de hedge fund e podcaster, executou o prompt idêntico e relatou ter gasto mais de dez horas e cerca de 1,3 milhão de tokens no Opus 5. A versão dele, Operation Blackout, é grátis para jogar no navegador. O desenvolvedor do Prompt Silo direcionou a mesma solicitação para o Sol 5.6 Ultra da OpenAI — o topo da família GPT-5.6 com três modelos que a OpenAI tornou geralmente disponível em 9 de Jul. O desenvolvedor Leon Lin fez engenharia reversa de um prompt detalhado com profundidade de 20 seções, especificando elementos de física ragdoll a mapas de sombras em cascata, e o alimentou no Cursor usando Opus 5 puro com esforço alto, sem subagentes e sem ultracode. O resultado dele, Dust Corridor, também roda no navegador. Nenhuma das versões seguintes enfrentou o teste cego que Shumer aplicou em seu projeto. O log do crítico de Shumer mostra Call of Duty real vencendo todas as rodadas que ele registrou.

Gauntlet Loop Method Reverses Traditional Prompt Engineering Approach

Shumer chama sua abordagem de Gauntlet Loop: entregar a um agente uma referência real e inspecionável em vez de instruções vagas, deixar ele dividir o trabalho em partes pequenas e encaminhar cada parte por um crítico que nunca vê a lógica do construtor. Duas funções do Claude Code sustentam o loop. Subagentes surgem em janelas de contexto isoladas, com suas próprias instruções e acesso a ferramentas, então um crítico avaliando um modelo de arma não herda as desculpas do construtor. Ultracode é uma configuração do Claude Code que empurra o modelo para o máximo esforço de raciocínio e permite que ele escreva seu próprio plano de orquestração, espalhando o trabalho para até 16 agentes ao mesmo tempo, com limite de 1.000 por execução. A habilidade interna /loop da Anthropic, criada para ciclos repetidos de corrigir-testar-ajustar, impediu que a execução parasse quando o jogo parecia bom. Shumer nunca especificou um número de rodadas e deixou o crítico continuar apontando novas lacunas por horas antes de encerrar a sessão.

Researchers Raise Data Contamination Concerns

O Three.js vem com seus próprios controles de câmera com pointer-lock como exemplo oficial, e o padrão base — olhar com o mouse, movimento WASD, raycasting para disparos — foi derivado e explicado em tutorial em GitHub, gists e fóruns de desenvolvedores por mais de uma década. Um modelo de codificação treinado em repositórios públicos provavelmente já viu centenas, senão milhares, de shooters quase idênticos antes de ler o prompt de Shumer. Pesquisadores que estudam modelos que geram código chamam o problema de contaminação de dados, quando um modelo vai bem em uma tarefa principalmente porque exemplos quase idênticos já estavam nos dados de treinamento, e não porque ele raciocinou algo novo. Nenhuma das versões publicadas de shooter em primeira pessoa verificou contaminação de dados. O repositório de Shumer contém código que o modelo gerou, mas isso torna “resolver de primeira um jogo AAA” um agente capaz trabalhando em um dos gêneros mais documentados da programação, em vez de prova de que uma IA desenhou um shooter sem arte anterior para se apoiar.

FAQ

O que o prompt do Claude Opus 5 de Matt Shumer tinha de fato? O prompt rodou três parágrafos curtos publicados no GitHub. Ele mandou o Opus 5 construir um shooter no nível de jogos recentes de Call of Duty, implantar subagentes para tarefas individuais e fazer loop de cada parte por um crítico separado até que coincidisse com imagens reais de Call of Duty em comparações lado a lado sem ver. Shumer nunca especificou o renderizador, listou sistemas do jogo nem definiu requisitos de qualidade AAA. Como outros desenvolvedores replicaram os resultados de construção do jogo com Claude Opus 5? James Altucher rodou o prompt idêntico e gastou mais de dez horas e cerca de 1,3 milhão de tokens no Opus 5 para construir a Operation Blackout. O desenvolvedor do Prompt Silo usou o Sol 5.6 Ultra da OpenAI com o mesmo prompt. O desenvolvedor Leon Lin fez engenharia reversa de um prompt detalhado de 20 seções e o alimentou no Cursor usando Opus 5 puro, sem subagentes e sem ultracode, produzindo Dust Corridor.

Isenção de responsabilidade: as informações nesta página podem ter origem em fontes terceiras e servem apenas como referência. Não representam as opiniões da Gate e não constituem orientação financeira, de investimentos ou jurídica. A negociação de ativos virtuais envolve alto risco. Não tome decisões baseando-se apenas nas informações desta página. Para mais detalhes, consulte a Isenção de responsabilidade.
Comentário
0/400
Sem comentários