Умная лента · Россия и мир Новости
Пустой гибрид серверного зала и физической лаборатории показывает длинную LLM как цепь модульных transformer-блоков, где целые секции вынимает кран по схеме Ising-оптимизации со сп

Multiverse режет LLM целыми блоками — не на глазок, а через физику

Multiverse Computing показала способ сжимать большие языковые модели грубым, но денежным движением: выкидывать из них целые transformer-блоки. Не отдельные веса подпиливать пинцетом, а реально делать модель короче. Меньше глубина — меньше память и быстрее инференс. Звучит как варварство, но иногда именно оно и нужно.

Главная засада — понять, какие блоки можно удалить. Старый подход часто такой: оценили каждый блок отдельно, слабых отправили за дверь. Проблема в том, что блоки не живут поодиночке. Убрал один — и вред зависит от того, что ещё выкинул рядом. В статье это объясняют на примере блоков 19, 20 и 24: решение по одному месту может менять цену решения по другому.

Авторы заворачивают выбор в constrained binary optimization. По-человечески: каждому блоку ставят переключатель «оставить / удалить», а потом ищут комбинацию с минимальной «энергией». Математика уходит в Ising glass — физическую модель со связанными спинами. Да, звучит как доска в кабинете, где мел уже сдался. Но бытовой смысл нормальный: не ранжировать детали по одной, а искать набор, который вместе ломает модель меньше.

Зачем это вообще нужно? Потому что после расчёта связей между блоками кандидатов можно быстро гонять через дешёвую энергетическую оценку, а не каждый раз прогонять полную модель по бенчмаркам. Для команд, которые платят за инференс железом и задержкой, это уже не академическая игрушка, а способ найти, где можно срезать без пожара.

Самая крепкая цифра из источника — 50% compression для Llama-3.3-70B-Instruct: авторы пишут про выигрыш почти в 23 процентных пункта на MMLU против лучшего сравниваемого метода удаления блоков. MMLU — не справка «модель стала умнее», а тестовый набор задач, но разрыв всё равно приличный. Особенно когда речь не про красивую демку, а про попытку выкинуть половину глубины.

Есть и границы. Точный перебор ещё возможен не всегда: пример с удалением 8 из 80 блоков у Llama-3.3-70B дал около 29 миллиардов конфигураций и занял примерно два дня на одной GPU. Когда полный перебор уже не вариант, авторы предлагают отдавать задачу классическим, квантовым или quantum-inspired решателям; открытый tabu solver в их проверках находил низкоэнергетические варианты за секунды.

Но это не кнопка «сжать любую LLM и не платить». Источник — блог-пост с описанием метода и результатов авторов, независимого прогона тут нет. Не раскрыта универсальная гарантия для любой модели, любого датасета и любой продовой нагрузки. Зато понятно, где практический угол: если качество держится, целые блоки — это прямая дорога к меньшей задержке, памяти и счёту за железо.

Источник: Hugging Face Blog

← Ко всем новостям