La noticia
AMD acordó este mes comprar Taalas, cuyos chips graban de forma permanente los pesos de un modelo en transistores. Dos semanas antes, Etched levantó 300 millones de dólares a una valoración de 10.300 millones de dólares para un procesador que corre transformers y nada más. Qualcomm cerró la compra, por unos 4.000 millones de dólares, de Modular, cuyo software existe para aflojar el control de CUDA. Tres empresas, una apuesta.
El análisis
La industria ha decidido que la IA dejó de moverse, y está vertiendo concreto en consecuencia.
Esta es la disyuntiva en términos simples. Una GPU de propósito general es más lenta y más sedienta que un chip construido para una sola tarea, y a cambio correrá lo que sea que le eches el próximo año. Un chip especializado es dramáticamente más rápido en aquello para lo que fue construido y no vale nada en todo lo demás. Elegir entre ellos es un pronóstico sobre qué tan estable es tu carga de trabajo, disfrazado de decisión de ingeniería.
La historia de los chips ha hecho este experimento varias veces y los resultados son inequívocos en ambas direcciones. Los aceleradores 3D de función fija eran más rápidos que el hardware gráfico programable a finales de los noventa, justo hasta que los desarrolladores quisieron efectos que el silicio no podía expresar, y los shaders programables los enterraron. La minería de Bitcoin fue en la otra dirección: SHA-256 nunca cambia, así que los ASIC aniquilaron al hardware general y nunca devolvieron el terreno. La función fija gana cuando el blanco se queda quieto. Pierde, y caro, cuando el blanco se mueve.
Entonces, ¿cuál de las dos es la IA? La respuesta honesta es que el transformer ha sido notablemente duradero, unos nueve años ya, y la inferencia se ha convertido en la mayor parte del gasto en cómputo, que es exactamente la condición que premia la especialización. Taalas apuesta por algo más estrecho que el transformer: pesos específicos, que viven vidas mucho más cortas. Los modelos se reemplazan cada pocos meses. Un chip con Llama 3.1 fundido en su interior es un hermoso artefacto de un martes en particular.
A lo que sigo volviendo es al muro de la memoria. Empuja estos diseños con más fuerza que cualquier convicción arquitectónica. La HBM es escasa, los precios de la memoria acaban de elevar el capex de Amazon en veinte mil millones de dólares y de multiplicar por 250 la ganancia de chips de Samsung, y cada uno de estos diseños es un intento de dejar de pagar ese peaje. Cuando la industria empieza a cablear sus supuestos en el silicio porque la alternativa se volvió impagable, eso es una restricción de oferta que dicta la arquitectura, y las restricciones de oferta se alivian. Lo que queda cuando los precios de la memoria se normalizan es un montón de chips muy rápidos que solo pueden pensar un pensamiento.
Las apuestas todavía pueden rendir. Quedan fechadas en el momento en que se funden, lo cual está bien si el período de recuperación es lo bastante corto. Solo nota que quienes construyen el hardware más inflexible en una generación lo están haciendo durante el tramo menos predecible que ha tenido el campo.
Otra mirada
La réplica fuerte es que estoy buscando el patrón en los gráficos cuando debería buscarlo en Bitcoin. El transformer ha sobrevivido nueve años, todos los laboratorios de frontera siguen lanzando uno, y la carga de trabajo debajo de la inferencia está convergiendo. Si un chip se paga solo en dieciocho meses y el modelo vive veinticuatro, la inflexibilidad no cuesta nada y la eficiencia es dinero gratis. A diez veces los tokens por vatio, la apuesta solo tiene que durar un ciclo de producto, y eso es algo en lo que es mucho más fácil acertar.
A destacar
- Taalas afirma lograr unos 17.000 tokens por segundo en Llama 3.1 8B con aproximadamente una décima parte del consumo de energía de una H200.
- El chip Sohu de Etched afirma una gran aceleración en inferencia frente al hardware de Nvidia, con más de 1.000 millones de dólares en contratos firmados antes de despachar.
- SK hynix, que fabrica la memoria que estos diseños intentan evitar leer, es inversionista en Etched.
En resumen
El silicio especializado es un pronóstico sobre estabilidad con disfraz de ingeniería. Antes de comprar la idea, pregunta cuánto se espera que viva el modelo que estás grabando en piedra, y si los precios de la memoria que hicieron que las cuentas cuadraran seguirán ahí cuando lleguen los chips.
— Hank