AMD acquires Taalas to boost inference performance by etching models in silicon
AMD приобрела стартап Taalas, который встраивает веса ИИ-моделей прямо в кремний, создавая специализированные микросхемы (MSIC), что повышает производительность инференса в десятки раз. Первая тестовая чип-платформа HC1 на 6 нм TSMC обработала Llama 3.1 8B со скоростью 16 960 токенов в секунду — в 48 раз быстрее, чем Nvidia, и в 8,5 раз — чем Cerebras. Веса хранятся в маске ROM, а кэши KV — в SRAM, что исключает зависимость от HBM.
Второе поколение HC2, выходящее этим летом, поддержит до 20 млрд параметров на чипе: для модели в 1 трлн параметров потребуется всего 50 таких ускорителей, что значительно эффективнее, чем сотни GPU или тысячи Groq LPUs. AMD планирует интегрировать Taalas в свои Helios-стеки, разделяя нагрузку: обработка промптов — на Instinct, генерация токенов — на Taalas. Переход на новую модель требует лишь замены двух металлических слоёв, что дешевле и быстрее, чем полный респин. Эта технология может сделать тестовое масштабирование (test-time scaling) экономически жизнеспособным, снижая стоимость токена и ускоряя ответы. Сделка закроется в IV квартале.