$AMD lançou um modelo de ponta, totalmente aberto, treinado inteiramente em GPUs MI300X e MI325X usando ROCm


Instella-MoE é um modelo de mistura de especialistas (mixture-of-experts) com 16 mil milhões de parâmetros, que ativa apenas 2,8 mil milhões de parâmetros por token, reduzindo os custos de inferência e mantendo-se competitivo com modelos densos e MoE com contagens de parâmetros ativas semelhantes ou superiores
Suporta uma janela de contexto de 64K e foi treinado ao longo de seis etapas, desde o pré-treinamento até à aprendizagem por reforço
A AMD também introduziu duas novas técnicas de eficiência:
- Gated Multi-head Latent Attention, que filtra as saídas de atenção de baixo valor.
- FarSkip-Collective, que sobrepõe a comunicação e o processamento, melhorando a velocidade do pré-treinamento em 12,7% e reduzindo o tempo até ao primeiro token em até 39,2%.
AMD-3,29%
Ver original
post-image
Esta página pode conter conteúdos de terceiros, que são fornecidos apenas para fins informativos (sem representações/garantias) e não devem ser considerados como uma aprovação dos seus pontos de vista pela Gate, nem como aconselhamento financeiro ou profissional. Consulte a Declaração de exoneração de responsabilidade para obter mais informações.
  • Recompensa
  • 2
  • Republicar
  • Partilhar
Comentar
Adicionar um comentário
Adicionar um comentário
GateUser-17ba047d
· 1m atrás
Como funciona a tecnologia blockchain
Ver originalResponder0
Mehedi667
· 7m atrás
😉🔥
Responder0
  • Fixado