A Microsoft, em 23 de julho, divulgou dois novos modelos para acesso público em prévia: MAI-Image-2.5-Pro e MAI-Voice-2-Flash; ao mesmo tempo, publicou dados internos de que, após o centro de atendimento passar a usar o MAI-Voice-2-Flash, o custo de computação cai 89%. O CEO da Microsoft, Satya Nadella, afirmou que, quando os modelos da própria empresa emparelham ou superam soluções de ponta, ele direciona o tráfego para o MAI.
Enquadramento de recursos e precificação do MAI-Image-2.5-Pro e do MAI-Voice-2-Flash
O MAI-Image-2.5-Pro é voltado para a geração avançada de imagens, com preço de US$ 5 por milhão de tokens de entrada de texto e US$ 106 por milhão de tokens de saída de imagens; o Bing Image Creator já foi totalmente substituído por MAI-Image-2.5, e o diretor global de criação da WPP, Rob Reilly, afirmou na divulgação da Microsoft que se trata de um “grande salto na área de ferramentas de mídia gerada”.
O MAI-Voice-2-Flash é voltado para cenários de processamento massivo de voz (como centrais de atendimento), é duas vezes mais rápido que o antecessor e tem custo 32% menor; após a central de atendimento trocar por este modelo, o custo de computação cai 89%. Nesta mesma divulgação, foram apresentados também os resultados da implantação no Bing Image Creator, no PowerPoint (com custo de GPU 84% menor que o do GPT-Image-2), no OneDrive (taxa de armazenamento +26%, latência -25%) e no Dragon Copilot (taxa de erro -50%).
Resultados específicos de economia de custos de GPU
A Microsoft revelou, na nota, os resultados de cada cenário da seguinte forma:
MAI-Voice-2-Flash (voz da central de atendimento): custo de computação reduzido em 89%; duas vezes mais rápido que o antecessor, com custo 32% menor
MAI-Image-2.5-Pro (PowerPoint): custo de GPU reduzido 84% em relação ao OpenAI GPT-Image-2
OneDrive ao trocar de modelo: taxa de armazenamento aumenta 26%, e a latência cai cerca de 25%
Dragon Copilot (MAI-Transcribe-1.5, transcrição médica): atende 170 mil profissionais de saúde; no trimestre anterior processou 28 milhões de registros de pacientes; ao transcrever e reconhecer idiomas em 58 idiomas, a taxa de erro de reconhecimento de linguagem cai relativamente 50%
MAI-Code-1-Flash (GitHub Copilot): a taxa de adoção de código é cerca de 10% maior que GPT-5.4 Mini e Claude Haiku 4.5; o consumo de tokens é 10% menor; pode ser executado em GPUs H100 e até A100
Estratégia de “roda de moinho” de Nadella e lógica de tráfego para MAI substituir modelos de ponta
Nadella publicou no X uma postagem com o título “difusão e controle de ponta”, na qual explica a estratégia de modelos da Microsoft: quando os modelos da própria empresa apresentarem desempenho igualando ou superando soluções substitutas de ponta, o tráfego é direcionado para o MAI, entregando serviços em larga escala com menor custo. O que sustenta essa estratégia é a metodologia “hill-climbing”: fazer com que os dados, o modelo e o produto “se encaixem” e formem uma roda de iteração contínua, em vez de depender de um único ciclo de treinamento para decidir vida ou morte.
Ele também afirmou que o sistema de avaliação “mesmo removendo qualquer um dos modelos, deve continuar subindo” — manter memória e habilidades fora do modelo, formando o verdadeiro controle que a Microsoft domina. Depois de afinar o MAI-Code-1-Flash no ambiente de aprendizado por reforço do Excel, ele pode ser executado em GPUs H100 e A100 de geração anterior, emparelhando GPT-5.6 na maioria das tarefas do Excel, enquanto libera o cluster mais recente GB200 para treinamento, e não para requisições de serviço.
Perguntas frequentes
Qual é o preço do MAI-Image-2.5-Pro e do MAI-Voice-2-Flash, respectivamente?
O MAI-Image-2.5-Pro custa US$ 5 por milhão de tokens de entrada de texto e US$ 106 por milhão de tokens de saída de imagens, já disponível em prévia pública no Azure. O MAI-Voice-2-Flash é duas vezes mais rápido que o antecessor, com custo 32% menor; os detalhes do preço ficam a cargo do comunicado oficial no Azure.
Quanto a Microsoft disse que o custo de GPU caiu no máximo após adotar os modelos MAI?
Com base nos dados internos divulgados pela Microsoft, após a central de atendimento passar a usar o MAI-Voice-2-Flash, o custo de computação cai 89%; ao mudar o PowerPoint para um modelo de imagem MAI, o custo de GPU cai 84% em relação ao GPT-Image-2; ao trocar o Dragon Copilot para o MAI-Transcribe-1.5, a taxa de erro de transcrição e reconhecimento de linguagem cai relativamente 50%. No entanto, todos esses números vêm de avaliações internas da Microsoft, e não de testes independentes de terceiros.
Como clientes corporativos usam o método de treinamento MAI da Microsoft via Azure?
A Microsoft, por meio dos produtos Foundry e Frontier Tuning no Azure, permite que clientes corporativos usem seus próprios dados para treinar modelos dedicados; a Microsoft destaca que o treinamento desses modelos usa “dados corporativos limpos e rastreáveis”, sem destilação por modelos de terceiros, para responder às questões de conformidade sobre a origem dos dados de treinamento.