d‑Matrix Raptor об’єднав AI-логіку з DRAM і заявив 100 ТБ/с на карту
4-нм обчислювальний кристал з’єднано face-to-face з нестандартною DRAM; 32 ГБ пам’яті мають працювати з наднизькою енергією передачі даних.

Стартап d‑Matrix показав на Hot Chips 2026 архітектуру Raptor для генеративного AI. Компанія називає її першим прискорювачем із тривимірно інтегрованою DRAM: обчислювальний кристал TSMC N4P з’єднано face-to-face з окремо спроєктованим кристалом пам’яті з кроком контактів 36 мкм. Одна карта має 32 ГБ і заявлену внутрішню смугу 100 ТБ/с — число значно вище за традиційні HBM-рішення, але воно описує дуже короткий вертикальний інтерфейс усередині пакета.
Логіка зверху, пам’ять знизу
Raptor перевертає звичну логіку пакування: обчислювальний шар розташований зверху, ближче до холодної пластини, а DRAM під ним одночасно виконує роль основи для сигналів PCIe та міжкристального зв’язку. За даними d‑Matrix, передавання біта через вертикальний інтерфейс потребує 0,37 пДж проти приблизно 2,4 пДж для переміщення даних до базового кристала HBM4. Компанія називає перше значення виміряним на робочому кремнії.
Однак близькість логіки створює теплову проблему. Пам’ять спроєктовано для температури переходу до 105°C, за якої час утримання даних скорочується з типових 32 до 4 мс. Отже, комірки доводиться оновлювати у вісім разів частіше. Щоб зменшити штраф, інженери розділили DRAM на невеликі банки; повний цикл refresh, за їхніми оцінками, забирає близько 1,37% пропускної здатності.
Надлишковість і захист даних
Кожен чиплет має 840 банків, із яких 72 використовуються як запасні. Спеціальна схема може відключити несправні ділянки без порушення симетрії каналів. На логічному кристалі працює код Reed–Solomon і додаткова CRC-перевірка. Це важливо для великого пакета, де один дефект DRAM не повинен перетворювати на брак усю дорогу карту.
Інтерфейс не має традиційного PHY та звичної пакетної структури. d‑Matrix порівнює кожен блок даних із попереднім і за потреби інвертує його, щоб зменшити кількість перемикань ліній. Проте передавання даних усе одно може споживати 296 Вт із заявленого бюджету пакета 422 Вт. Отже, рідинне охолодження та живлення залишаються серйозними вимогами.
Продуктивність поки модельна
Компанія прогнозує приблизно у 4,7 раза вищу пропускну продуктивність карти порівняно з HBM-рішеннями та наводить 988 токенів за секунду на користувача для моделі Kimi K3 із 2,8 трлн параметрів і контекстом один мільйон токенів. Але ці результати є проєкціями на основі раннього кремнію. Незалежних тестів готової серійної карти немає, а ціна й точна дата масового запуску не оголошені; орієнтиром названо 2027 рік.
Найбільша невизначеність — виробництво спеціальної DRAM. d‑Matrix назвала TSMC для логіки й Alchip як партнера з ASIC та пакування, але не розкрила фабрику пам’яті. У період дефіциту HBM і звичайної DRAM отримати великі обсяги нестандартного кристала буде складно.
Чому підхід важливий
Raptor демонструє, що боротьба за AI-продуктивність переходить від кількості арифметичних блоків до відстані, на яку потрібно переносити дані. Вертикальне з’єднання може різко знизити енергію доступу, але вимагає спільного проєктування пам’яті, логіки, охолодження та корекції помилок. Якщо d‑Matrix підтвердить заяви у серійному продукті, це стане альтернативою класичній схемі «GPU плюс кілька стеків HBM». Поки Raptor залишається перспективною, але ще не доведеною у виробництві архітектурою.
Матеріал підготовлений редакцією HARDW на основі публікації Tom’s Hardware.
Відкрити оригінал на Tom’s Hardware ↗




