Zpět na článek

Diskuze: AMD kupuje startup Taalas, který vyvíjí čipy pro inferenci AI

Nejsi přihlášený(á)

Pro psaní a hodnocení komentářů se prosím přihlas ke svému účtu nebo si jej vytvoř.

Rychlé přihlášení přes:

Jan Belka
Jan Belka
Level Level
Windows
AMD
AMD
včera 14:47

Komentáře tohoto uživatele máš zablokované.

pozitivni zprava. mohlo by to snizit casem zajem o pametovy cipy do AI..

Milan Šurkala
Milan Šurkala
SHW SHW
Windows
AMD
NVIDIA
dnes 10:29

Komentáře tohoto uživatele máš zablokované.

@Jan Belka Osobně si nemyslím, že by to se zájmem o paměti mohlo udělat nějakou zásadní změnu. Resp. trochu asi ano, ale čipovou krizi to nevyřeší. Nemá moc jak.

1, Řeší to jen inferenci, ale ne trénování. Inference sice nabírá na podílu, ale obří část trhu bude beze změny.

2, V rámci samotné inference se to hodí jen na některé úlohy, a to zejména tam, kde je naprosto kritická latence a může na tom běžet hloupější model. Takže nejenže to nevyřeší všechny AI požadavky na paměť, ale jen inferenci, i v té inferenci to má smysl jen pro některé typy úloh.

3, Uloží to sice model, ale už ne KV cache a data. Tady bude paměť potřeba pořád. Má-li to zvládat delší kontexty, bude potřeba více paměti. Pokud chceme množství paměti snížit, kontexty musí být krátké, a to zase limituje množství úloh, kde se to dá použít.

4, Je to statické, pouze na jeden model. Chcete-li vyměnit model, musíte vyměnit čip. Tzn. se vracíme k bodu 2 a 3. Máme jen část situací, kdy se to hodí, a zde ještě musíme brát v úvahu to, zda tu bude nebo nebude vadit ono "zapečení" modelu do čipu. Takže např. OpenAI na tom ChatGPT rozběhávat nebude, protože ten se mění neustále.

5, Pokud se inference pro tyto některé úlohy zrychlí a zlevní, může to způsobit nárůst zájmu o tyto čipy. Tedy větší poptávku po čipech, jen jiných.

6, Když na waferu nevyrobíte paměť (třeba DDR/GDDR/HBM), tak na něm budete muset vyrobit tento čip. Množství waferů, které budete potřebovat vyrobit, neklesne. Čipovou krizi tím nevyřešíte. Spíše těch waferů budete potřebovat ještě více. Jestli tohle na 815 mm2 pobere 8B 3bitový model, tak v těch obvodech máte "zapečeno" cca 3 GB dat. 3GB GDDR7 křemík má odhadem cca 100 mm2. Na stejně velký model tak potřebujete 8krát tolik waferů. O něco to zlepšuje fakt, že v případě Taalasu to zahrnuje už i výpočetní čip, který se k těm GDDR/HBM pamětem musí dodat, ale asi chápete problém.

Pokud to sníží potřebu pamětí, tak v optimistickém případě to budou nějaké jednotky procent. Může to vyřešit některé specifické inferenční úlohy, kde je potřeba okamžitá odezva, model se nemění moc často, ale paměťovou krizi to nijak zásadně nevyřeší. Je dokonce riziko, že i zhorší.

Reklama
Reklama