ByteDance inicia o pré-treinamento de um modelo com 10 trilhões de parâmetros, aproximando-se da escala do Mythos 5, da Anthropic

Segundo o monitoramento da Beating, o Financial Times informou, citando três fontes, que a ByteDance começou o pré-treinamento de um grande modelo de linguagem com até 10 trilhões de parâmetros. O projeto ainda está em seus estágios iniciais, e a escala final ainda não foi determinada. Se treinado em capacidade total, ele superaria a escala do Kimi K3 em mais de três vezes, tornando-se o maior modelo conhecido em número de parâmetros desenvolvido por uma equipe chinesa.

A Anthropic não divulgou a quantidade de parâmetros do Mythos 5, mas o Financial Times citou estimativas do setor que colocam o Mythos 5 em aproximadamente 8 trilhões de parâmetros. O modelo da ByteDance, se alcançar 10 trilhões de parâmetros, entraria na mesma escala de parâmetros dos principais modelos de código fechado dos EUA. Atualmente, o modelo está na fase de pré-treinamento, que normalmente requer de 3 a 6 meses, seguida pelo pós-treinamento antes de uma possível liberação.

Isenção de responsabilidade: as informações nesta página podem ter origem em fontes terceiras e servem apenas como referência. Não representam as opiniões da Gate e não constituem orientação financeira, de investimentos ou jurídica. A negociação de ativos virtuais envolve alto risco. Não tome decisões baseando-se apenas nas informações desta página. Para mais detalhes, consulte a Isenção de responsabilidade.
Comentário
0/400
Sem comentários