Nové akcelerátory Nvidia Rubin mají o 62 % více tranzistorů než Blackwell. Spolu s dalšími optimalizacemi to umožní spustit na čipu až 10krát více AI agentů než doposud.
Agentická AI vyžaduje od modelů nejen prosté generování odpovědí, ale také neustálé přizpůsobování se prostředí a práci s různými nástroji v reálném čase. Ty, které mohl používat před týdnem, už nemusí používat v tom dalším. Nvidia proto přichází s architekturou Rubin, která má lépe odpovídat těmto potřebám měnícího se AI trhu.

Čip je vyráběn procesem TSMC N3P a skládá se ze dvou chipletů po čtyřech GPC. Celkem obsahuje 336 mld. tranzistorů, což je nárůst o 62 % oproti předchozí generaci Blackwell. Má celkově 224 SM a 896 Tensor Core (ty nyní dosahují dvojnásobné propustnosti za cyklus), přičemž toto vše je rozděleno na 8 GPC (ta mají 26 nebo 30 SM). Podporováno je PCIe Gen 6 a NVLink.

Pro agentické úlohy je však velmi důležitý paměťový systém. Rubin využívá paměti HBM4 s celkovou kapacitou 288 GB (osm 36GB 12-Hi čipů) s celkovou propustností 22 TB/s. To je 2,8× nárůst oproti architektuře Blackwell a pomáhá to řešit problém dlouhých kontextů a velkých KV cache, což je něčím, na čem stojí agentická AI.

K dispozici je také vylepšený Tensor Memory Accelerator (TMA), který optimalizuje paměťové přesuny. Zde jde především o snižování režie při adresování expertních vah MoE modelů. Ty totiž z celkového počtu parametrů využívají současně jen menší část, a tak se schopnostmi přibližují hustým modelům se stejně velkým celkovým počtem parametrů, ale rychlostí jsou naopak bližší těm s menším.
Vše je také hodně spojeno s procesorem Vera CPU s vlastními jádry Olympus, které nabízí dvojnásobný ST výkon a dosahuje o 40 % nižší latence paměti než chipletové návrhy, jako je např. EPYC Venice. Oproti předchozí generaci se také zrychlila komunikace jader mezi sebou, a to 3násobně.
Dále tu máme novou verzi operačního systému DSX MaxLPS, který pomocí vyrovnávání špičkových příkonů snižuje průměrnou spotřebu o 10 % a umožňuje v rámci stejného energetického “budgetu” nasadit až o 40 % více GPU, která jsou efektivněji využívána. První racky Vera Rubin NVL72 již běží u poskytovatelů CoreWeave, Google Cloud i Microsoft Azure.






















