Новости

Новостной портал GADGETPAGE » Новости » Китайская система ускорила нейросеть в 149 раз без мощного GPU

Китайская система ускорила нейросеть в 149 раз без мощного GPU

Китайские исследователи показали, что для резкого ускорения нейросетей не всегда нужны более производительные чипы. Экспериментальная система обработала изображения почти в 149 раз быстрее мощного графического процессора, хотя её заявленная вычислительная мощность была значительно ниже.

Секрет оказался не в новом процессоре. Учёные изменили сам способ передачи информации между вычислительными блоками и убрали лишнюю работу с памятью.

Нейросеть разделили между пятью чипами

Систему разработали специалисты Пекинского университета. В её основе находятся пять программируемых микросхем FPGA. Каждая из них отвечает только за один слой пятислойной свёрточной нейросети.

Обычно графический процессор последовательно выполняет разные этапы вычислений. Промежуточные результаты при этом приходится сохранять в память, а затем снова загружать для обработки следующим слоем.

Эти операции занимают время и создают так называемую стену памяти. Чип может быстро считать, но вынужден ждать, пока нужные данные будут переданы из одного участка системы в другой.

Китайские разработчики выстроили вычисления по принципу конвейера. Первый чип обрабатывает свой слой и сразу отправляет результат второму. Тот передаёт данные дальше, и процесс не останавливается ради постоянного обращения к внешней памяти.

Данные передавались с помощью света

Пять FPGA соединили кремниевыми фотонными передатчиками и оптическим коммутатором. Информация между чипами передавалась по оптоволокну со скоростью до 400 Гбит/с.

Четыре потока по 100 Гбит/с шли по одному волокну на разных длинах волн. Сам коммутатор теоретически может связать до 16 вычислительных чипов с общей пропускной способностью 6,4 Тбит/с.

Оптическая передача уменьшила задержки между этапами обработки. В результате каждый чип почти постоянно занимался полезной работой, а не ожиданием новых данных.

Использование вычислительных блоков FPGA достигло 94,7 %. Для сравнения, в обычных системах часть мощности нередко простаивает из-за ограничений памяти и передачи данных.

Слабая система обогнала более мощный GPU

Производительность экспериментальной платформы составляла около 1,97 Тфлопс. У графического процессора, с которым её сравнивали, этот показатель достигал 16,96 Тфлопс.

На бумаге GPU был мощнее почти в девять раз. Но в практическом тесте всё получилось наоборот.

Система обработала тысячу изображений размером 32 × 32 пикселя за 105,16 микросекунды. Графическому процессору понадобилось 15,643 миллисекунды. Разница составила почти 149 раз.

Такой результат хорошо показывает, почему одни только терафлопсы не описывают реальную скорость. Если архитектура плохо справляется с передачей данных, часть вычислительной мощности остаётся невостребованной.

До больших языковых моделей ещё далеко

Эксперимент проводился на простой пятислойной нейросети и наборе изображений Fashion-MNIST. Это небольшая учебная задача, которую нельзя напрямую сравнивать с работой ChatGPT или других современных генеративных моделей.

Большие языковые модели содержат миллиарды параметров и требуют намного больше памяти. Их нельзя просто разделить между несколькими FPGA по той же схеме и сразу получить ускорение в сотни раз.

Однако работа учёных показывает общий принцип. Производительность можно повышать не только выпуском более быстрых чипов, но и совместной оптимизацией алгоритмов, процессоров и каналов связи.

Оптимизация может снизить расходы дата-центров

Современные ИИ-системы потребляют всё больше электричества, а ускорители остаются дорогими и дефицитными. Поэтому отрасль начинает внимательнее смотреть на то, насколько эффективно используется уже доступное оборудование.

Если уменьшить количество обращений к памяти и ускорить обмен данными между чипами, ту же задачу можно выполнить быстрее и с меньшими затратами энергии.

Китайская система пока остаётся исследовательским прототипом, а не готовой заменой GPU. Но её результат напоминает простую вещь: иногда главный резерв производительности скрывается не внутри процессора, а в том, как организована работа всей системы.