ИИ

Эффективные Large Language Models: от линейного attention к гибридным архитектурам, наши результаты и выводы

Квадратичная сложность и линейно растущий KV cache в классическом механизме внимания, используемом в современных LLM, — серьёзная преграда для обработки экстремально длинных контекстов, особенно в условиях ограниченной видеопамяти на GPU. В этой статье мы рассмотрим различные варианты Linear Attention (линейного внимания) и техники дистилляции LLM в субквадратичные варианты механизма внимания. Мы также расскажем о наших экспериментах с GigaChat и поделимся примером получившейся гибридной модели с линейным вниманием, сделанной на основе Llama-8B.

21.11.2025 06:00

ИИ

Источник: Все публикации подряд на Хабре

Вернуться к ленте

Фильтры и сортировка