295 FLOP/byte: почему пиксель и токен стоят одинаково дорого

Разработка

Тезисы

На кухне все мы слышали истории «FLOPS выросли в двести раз, а память не успела». Открываем даташиты и считаем по векторному FP32, без тензорных ядер: G80 в 2006-м даёт 6 FLOP на байт, B200 сегодня — 9.7. Рост в 1.6 раза за 18 лет, и Kepler 2013 года лучше обоих.

Двести раз появляются только на тензорных ядрах и низкой разрядности — то есть разрыв не вырос сам, его намеренно сделали. Там же живёт и 295 ridge point H100 на FP16.

В докладе разберёмся, как графика построила железо для AI и оставила ему свои узкие места: кто и когда принимал ключевые решения и почему обратной дороги нет.

Поговорим про on-chip SRAM — и при чём тут тайловый рендеринг и flash attention. Про wave quantization в GEMM и квад 2×2 на кромке треугольника — одно явление на разной гранулярности. Про регистровое давление и реальную цену запуска kernel и draw call. В конце поищем остатки графики в датацентровом железе для AI. Все примеры — из production и собственных замеров.

Уйдём с одним способом думать о производительности вместо двух и научимся считать арифметическую интенсивность своего прохода или ядра ещё до профилировки — чтобы заранее знать, во что упрёмся.


Аудитория

Для всех


Уровень сложности

Экспертный

Some Stealth Startup
Илья Макаров

Ведущий инженер в Collabo, AI-энтузиаст. 10+ лет коммерческого опыта разработки графики, преподаватель в ИТМО.

В прошлом руководил командами разработки 3D-движка в одной крупной картографической компании.

Другие спикеры трека Разработка