ByteDance treina modelo com até 10 biliões de parâmetros
A notícia mostra a velocidade da corrida chinesa por modelos de fronteira, mas o número bruto não prova que o sistema será melhor, mais eficiente ou economicamente viável.
O que foi noticiado
A ByteDance está a treinar um modelo com até 10 biliões de parâmetros, segundo o Financial Times citado pela Reuters. O sistema teria mais de três vezes o tamanho total do Kimi K3, da Moonshot, e aproximar-se-ia das estimativas atribuídas ao Mythos da Anthropic. A Reuters não conseguiu confirmar independentemente a informação e a ByteDance não respondeu ao pedido de comentário.
Escala não é inteligência
Parâmetros são valores aprendidos durante o treino e ajudam a descrever o tamanho de um modelo, mas não permitem comparar diretamente capacidade, eficiência ou custo. Arquitetura, dados, número de parâmetros ativos e qualidade do pós-treino podem ser mais importantes do que o total anunciado. A comparação é ainda mais difícil porque OpenAI e Anthropic não publicam contagens oficiais dos principais modelos.
O que acompanhar
O pré-treino deverá durar entre três e seis meses antes da afinação e de uma eventual apresentação. O teste real será verificar se a ByteDance consegue converter escala em desempenho competitivo sem tornar inferência, energia e infraestrutura proibitivamente caras.
Fonte original
Ler na Reuters / Financial Times ↗