HARDW / НОВИНИУкраїнською про комп’ютерне залізо, гаджети, бенчмарки та технології
HARDWзалізо. чесні цифри.

Cerebras додасть стековану DRAM до майбутнього wafer-scale прискорювача CS-6

Компанія розвиває обчислювач розміром із кремнієву пластину: Nexus уже підвищує потужність CS-4, а наступні покоління мають подолати обмеження 44 ГБ локальної SRAM.

Wafer-scale прискорювач Cerebras у модульній серверній системі Nexus
Wafer-scale прискорювач Cerebras у модульній серверній системі Nexus

Cerebras на Hot Chips 2026 показала напрям розвитку своїх wafer-scale систем — прискорювачів, у яких більшу частину 300-мм кремнієвої пластини використовують як один обчислювальний пристрій. Нинішня платформа CS-4 отримує модульну архітектуру Nexus, а у віддаленішому поколінні CS-6 компанія планує розмістити DRAM над логікою та SRAM. Це має збільшити доступну пам’ять без відмови від обчислювальних блоків на самій пластині.

Перевага підходу Cerebras — величезна внутрішня пропускна здатність і відсутність багатьох зовнішніх з’єднань між дрібними GPU. Проте площа пластини обмежена: додавання SRAM забирає місце у логіки, а збільшення логіки зменшує локальну пам’ять. Сьогодні WS-3T має 44 ГБ SRAM, тому три пластини в системі CS-4 дають 132 ГБ. Для порівняння, великі GPU-стійки конкурентів оперують десятками терабайтів HBM, хоча їхня архітектура й характер обміну даними відрізняються.

Що змінює Nexus

CS-4 містить три оновлені WS-3T у самодостатніх модулях, які Cerebras називає backpack. Кожен об’єднує пластину, живлення, рідинне охолодження та інтерфейси масштабування. Модуль можна замінити без демонтажу всієї стійки, що полегшує обслуговування й майбутній апгрейд. Окремі блоки вводу-виводу підключаються до країв пластини та забезпечують RoCE v2 RDMA й прямий зв’язок з іншими WSE.

Вертикальне встановлення дозволило підвести мідну шину живлення безпосередньо до задньої сторони пластини. За твердженням виробника, менші втрати дають змогу подати вдвічі більше потужності, підняти частоти й отримати до дворазового приросту продуктивності WS-3T порівняно з WS-3. Компанія наводить показники розріджених FP16-обчислень, тому їх не слід прямо прирівнювати до щільних FLOPS звичайних GPU.

Стекована пам’ять — найскладніша частина плану

У CS-6 Cerebras хоче розмістити DRAM поверх wafer-scale логіки та SRAM. Тривимірне компонування скорочує довжину з’єднань і може різко збільшити місткість поруч з обчисленнями. Але з’єднати два великі шари з прийнятним виходом придатних пристроїв набагато складніше, ніж упакувати кілька невеликих кристалів. Дефект на великій площі, теплове розширення або проблема з відведенням тепла можуть вплинути на весь модуль.

Проміжне покоління CS-5 із новим WSE заплановане на 2027 рік. Cerebras заявляє до 10 000 токенів на секунду для менших моделей і до 5000 для великих моделей рівня frontier. Це прогноз виробника для майбутньої системи, а не незалежний бенчмарк; реальний результат залежатиме від моделі, точності, довжини контексту й кількості одночасних користувачів.

Для ринку значення roadmap полягає у спробі масштабувати AI не лише через дедалі більші кластери GPU. Wafer-scale конструкція міняє мережеві з’єднання на надшвидку внутрішню тканину, а стекована DRAM має прибрати її головне обмеження — місткість пам’яті. Якщо Cerebras реалізує задум без неприйнятних проблем із теплом, виходом придатних пластин і вартістю, CS-6 стане серйозною перевіркою альтернативної архітектури для швидкого інференсу.

Першоджерело

Матеріал підготовлений редакцією HARDW на основі публікації Tom’s Hardware.

Відкрити оригінал на Tom’s Hardware ↗