ByteDance treina modelo com até 10 biliões de parâmetros

A notícia mostra a velocidade da corrida chinesa por modelos de fronteira, mas o número bruto não prova que o sistema será melhor, mais eficiente ou economicamente viável.

O que foi noticiado

A ByteDance está a treinar um modelo com até 10 biliões de parâmetros, segundo o Financial Times citado pela Reuters. O sistema teria mais de três vezes o tamanho total do Kimi K3, da Moonshot, e aproximar-se-ia das estimativas atribuídas ao Mythos da Anthropic. A Reuters não conseguiu confirmar independentemente a informação e a ByteDance não respondeu ao pedido de comentário.

Escala não é inteligência

Parâmetros são valores aprendidos durante o treino e ajudam a descrever o tamanho de um modelo, mas não permitem comparar diretamente capacidade, eficiência ou custo. Arquitetura, dados, número de parâmetros ativos e qualidade do pós-treino podem ser mais importantes do que o total anunciado. A comparação é ainda mais difícil porque OpenAI e Anthropic não publicam contagens oficiais dos principais modelos.

O que acompanhar

O pré-treino deverá durar entre três e seis meses antes da afinação e de uma eventual apresentação. O teste real será verificar se a ByteDance consegue converter escala em desempenho competitivo sem tornar inferência, energia e infraestrutura proibitivamente caras.

Fonte original

Ler na Reuters / Financial Times

PARTILHAR

Vale a pena passar adiante?