D’après The Information, Google développe Frozen v2, une nouvelle puce serveur d’IA qui intègre directement l’architecture sous-jacente de Gemini dans le silicium afin d’améliorer l’efficacité de l’inférence jusqu’à 10 fois. Contrairement aux puces généralistes comme les GPU et les TPU maison de Google, Frozen v2 sacrifie la polyvalence au profit d’une efficacité d’inférence supérieure et d’une consommation d’énergie réduite, en encodant l’architecture des modèles directement dans le matériel.
Le projet découle d’une pénurie aiguë de capacité de calcul IA chez Google, qui a mis à rude épreuve ses ressources internes en GPU et en TPU et a affecté certains clients de Google Cloud. Google a déjà accepté de payer à SpaceX environ 1 milliard de dollars par mois pour la capacité de calcul IA fournie par xAI afin de combler le déficit d’infrastructure.