De acordo com a Beating, a Google está desenvolvendo o chip de inferência de IA Frozen v2, que incorporará parte da arquitetura do Gemini diretamente ao hardware para reduzir o custo de computação e a sobrecarga de movimentação de dados durante a execução do modelo. O chip deverá processar de 6 a 10 vezes mais tokens por watt do que o mais recente TPU da Google, com implantação prevista para o mais cedo em 2028.
A iniciativa busca enfrentar a piora na escassez de chips da Google, que já levou o Google Cloud a recusar pedidos de clientes externos. O Frozen v2 vai operar em conjunto com o TPU: enquanto o TPU dá suporte a vários modelos, o Frozen v2 prioriza eficiência em vez de flexibilidade.