21 сентября 2026 г.
Multiverse Computing применила модель Изинга для удаления блоков из LLM
Исследователи превратили выбор удаляемых блоков языковой модели в задачу бинарной оптимизации. На Llama 3.3 70B Instruct новый метод заметно превзошёл другие способы блочного сжатия при удалении половины блоков.

Исследователи Multiverse Computing предложили выбирать блоки для удаления из больших языковых моделей с помощью ограниченной бинарной оптимизации. Метод учитывает взаимное влияние блоков и в эксперименте с Llama 3.3 70B Instruct сохранил больше качества при глубоком сжатии, чем сравниваемые подходы.
Удаление целых трансформерных блоков сокращает глубину модели, расход памяти и время выполнения. Однако простое ранжирование блоков по отдельности не показывает, как совместное удаление нескольких участков повлияет на результат.
Выбор блоков стал задачей со связанными переменными
Авторы назначают каждому блоку бинарную переменную: сохранить или удалить. Затем они оценивают матрицу взаимодействий через разложение функции потерь второго порядка. Диагональные элементы описывают вклад отдельных блоков, а остальные учитывают их попарное влияние.
Полученная задача соответствует поиску низкоэнергетических состояний модели Изинга при фиксированном числе удаляемых блоков. Энергия служит дешёвой оценкой качества конфигурации, поэтому исследователям не требуется запускать полный набор тестов для каждого варианта.
| Этап | Результат |
|---|---|
| Калибровка | Матрица взаимодействий вычисляется один раз |
| Поиск | Кандидаты сравниваются через расчёт энергии |
| Проверка | Несколько лучших конфигураций тестируются на модели |
На Llama 3.3 70B выигрыш достиг почти 23 пунктов MMLU
При удалении 50% блоков Llama 3.3 70B Instruct метод получил результат MMLU почти на 23 процентных пункта выше лучшего конкурирующего способа блочного удаления. Это результат конкретного эксперимента, а не гарантия такого же прироста для других моделей и наборов задач.
Полный перебор остаётся дорогим. Проверка примерно 29 миллиардов вариантов при удалении 8 из 80 блоков заняла около двух дней на одном GPU. Для более крупных пространств авторы применили открытый tabu solver, который находил низкоэнергетические решения за секунды в случаях, где результат можно было сопоставить с полным перебором.
Что проверить перед использованием метода
Студентам и исследователям, изучающим сжатие LLM, стоит отдельно сравнивать качество до и после удаления блоков на задачах своего проекта. Энергия модели Изинга остаётся приближённым показателем: конфигурация с минимальной энергией не всегда даёт лучший итоговый результат. Также нужно фиксировать калибровочный набор, долю удалённых блоков, используемый решатель и показатели задержки, памяти и качества.