Нейросети перенесли вычисления в память и вернули до 20% потерянной точности

leer en español

1516
Нейросети перенесли вычисления в память и вернули до 20% потерянной точности

Большую языковую модель пришлось столкнуть с физикой реального железа.

image

Главным препятствием для вычислений прямо в памяти оказалась не нехватка мощности, а шум самих ячеек, из-за которого нейросети быстро теряли точность. Команда из Гонконга и Шэньчжэня представила метод BSQ, который приспосабливает к физике мемристоров уже обученные модели и сокращает потери без повторного обучения.

В обычном компьютере процессор постоянно переносит параметры модели из памяти, выполняет операции и отправляет результаты обратно. Compute-in-memory, или CIM, убирает часть такого обмена. Мемристорная матрица хранит веса и одновременно выполняет векторно-матричные операции, которые лежат в основе нейросетей. Такой подход снижает задержки и потенциально экономит энергию.

Проблема возникает при переходе от идеальной математики к аналоговой электронике. Проводимость мемристоров нельзя задавать абсолютно точно, а записанное значение немного меняется из-за физических флуктуаций. При низкой разрядности ошибки отдельных ячеек накапливаются по слоям модели. На глубоких сетях такой аппаратный шум способен заметно испортить результат.

BSQ разбивает каждый вес нейросети на несколько бинарных слоёв, где ячейке нужны лишь два устойчивых состояния. Отдельные слои получают обучаемые коэффициенты, а периферийная схема складывает их вклад и восстанавливает более точное значение. Вместо попытки заставить мемристор надёжно хранить множество уровней проводимости алгоритм использует простые состояния включено и выключено.

Дополнительно метод учитывает распределение исходных весов и подбирает уровни квантования неравномерно. Во время подготовки в бинарные слои вводят шум, соответствующий измеренным характеристикам физических ячеек. Такой аппаратно-программный подход уже помогал компенсировать дефекты мемристорных массивов, но BSQ нацелен именно на низкоразрядный запуск обычных нейросетей.

На распознавании рукописных цифр двухбитная BSQ-модель сохранила точность 98,2% при 5-процентном разбросе проводимости. Обычное равномерное квантование в тех же условиях показало 82,2%. Даже при значительно более сильном шуме с σ = 0,30 результат BSQ снизился лишь примерно с 98,28% до 95,75%, тогда как разрыв с традиционным методом оставался большим.

В задаче анализа тональности преимущество оказалось скромнее. Трёхбитная TextCNN на наборе SST-2 набрала 80,6% при моделируемом 5-процентном разбросе против 80,1% у обычного квантования. Полноточная версия показывала 81,08%. Для авторов такой результат важен прежде всего как подтверждение того, что выигрыш сохраняется не только на простом распознавании изображений.

Самую заметную разницу получили на LLaMA-3.1-8B. В трёхбитном режиме с моделируемым аппаратным шумом BSQ набрала 55,36% на HellaSwag против 35,28% у GPTQ. Разрыв составил 20,08 процентного пункта. В двухбитном режиме преимущества на отдельных тестах были ещё крупнее, а BSQ продолжала выдавать корректные результаты там, где сравнительный метод становился нестабильным.

Результаты с большой языковой моделью пока относятся именно к симуляции аппаратного шума, а не к запуску всей LLaMA-3.1-8B на мемристорной матрице. Параметры симуляции авторы откалибровали по измерениям реального оборудования. Для аппаратной части команда изготовила кроссбар 512 × 512 по 40-нм техпроцессу с резистивными ячейками на основе оксида тантала.

BSQ работает после обучения модели, поэтому заново обучать многомиллиардную сеть под конкретный массив не требуется. В случае дальнейшего масштабирования такой подход может приблизить нейросети к устройствам, где хранение параметров и основные матричные операции происходят в одном блоке. Подобные вычисления прямо в памяти уже испытывают для периферийного ИИ, где критичны энергопотребление и задержка.

Реклама 18+
Рекламодатель
Реклама. АО «Позитив Текнолоджиз». ИНН 7718668887. 18+
Сайт рекламодателя: ptsecurity.com
Реклама