A notícia
A AMD fechou neste mês um acordo para comprar a Taalas, cujos chips gravam os pesos de um modelo de forma permanente nos transistores. Duas semanas antes, a Etched captou US$ 300 milhões a um valuation de US$ 10,3 bilhões para um processador que roda transformers e mais nada. A Qualcomm concluiu a compra, por cerca de US$ 4 bilhões, da Modular, cujo software existe para afrouxar o domínio do CUDA. Três empresas, uma aposta.
A análise
A indústria decidiu que a IA parou de se mover e está despejando concreto de acordo.
Eis a troca em termos simples. Uma GPU de uso geral é mais lenta e mais sedenta do que um chip construído para uma única tarefa e, em compensação, vai rodar o que quer que você jogue nela no ano que vem. Um chip especializado é dramaticamente mais rápido naquilo para que foi construído e não vale nada em todo o resto. Escolher entre os dois é uma previsão sobre o quão estável é a sua carga de trabalho, fantasiada de decisão de engenharia.
A história dos chips já fez esse experimento várias vezes, e os resultados são inequívocos nas duas direções. Os aceleradores 3D de função fixa eram mais rápidos que o hardware gráfico programável no fim dos anos noventa, até o momento em que os desenvolvedores quiseram efeitos que o silício não conseguia expressar, e os shaders programáveis os enterraram. A mineração de Bitcoin foi no sentido contrário: o SHA-256 nunca muda, então os ASICs aniquilaram o hardware de uso geral e nunca mais devolveram o terreno. A função fixa vence quando o alvo fica parado. Perde, e caro, quando o alvo se move.
Então, qual dos dois é a IA? A resposta honesta é que o transformer tem sido notavelmente durável, cerca de nove anos até agora, e a inferência se tornou a maior parte do gasto com computação, que é exatamente a condição que recompensa a especialização. A Taalas aposta em algo mais estreito do que o transformer: pesos específicos, que têm vidas muito mais curtas. Os modelos são substituídos a cada poucos meses. Um chip com o Llama 3.1 fundido nele é um belo artefato de uma terça-feira específica.
Aquilo a que sempre volto é o muro da memória. Ele impulsiona esses projetos com mais força do que qualquer convicção arquitetural. A HBM é escassa, os preços de memória acabam de empurrar o capex da Amazon para cima em vinte bilhões de dólares e de elevar o lucro de chips da Samsung em 250 vezes, e cada um desses projetos é uma tentativa de parar de pagar esse pedágio. Quando a indústria começa a gravar suas premissas diretamente no silício porque a alternativa ficou cara demais, isso é uma restrição de oferta ditando a arquitetura, e restrições de oferta se afrouxam. O que sobra quando os preços de memória se normalizam é um monte de chips muito rápidos que só conseguem pensar um pensamento.
As apostas ainda podem dar retorno. Elas datam o momento em que são fundidas, o que não é problema se o prazo de retorno for curto o bastante. Só repare que as pessoas que estão construindo o hardware mais inflexível de uma geração estão fazendo isso durante o período menos previsível que a área já teve.
Outro olhar
O contra-argumento forte é que estou buscando o padrão nos gráficos quando deveria buscá-lo no Bitcoin. O transformer sobreviveu nove anos, todo laboratório de fronteira ainda lança um, e a carga de trabalho por baixo da inferência está convergindo. Se um chip se paga em dezoito meses e o modelo vive vinte e quatro, a inflexibilidade não custa nada e a eficiência é dinheiro de graça. Com dez vezes mais tokens por watt, a aposta só precisa durar um ciclo de produto, e isso é algo muito mais fácil de acertar.
Vale destacar
- A Taalas afirma atingir cerca de 17.000 tokens por segundo no Llama 3.1 8B, com aproximadamente um décimo do consumo de energia de uma H200.
- O chip Sohu, da Etched, afirma ter um grande ganho de velocidade em inferência sobre o hardware da Nvidia, com mais de US$ 1 bilhão em contratos assinados antes das entregas.
- A SK hynix, que fabrica a memória que esses projetos tentam evitar ler, é investidora da Etched.
Em resumo
Silício especializado é uma previsão sobre estabilidade vestindo uma fantasia de engenharia. Antes de embarcar nela, pergunte quanto tempo se espera que viva o modelo que você está gravando em pedra, e se os preços de memória que fizeram a conta fechar ainda estarão lá quando os chips chegarem.
— Hank