EN

SLM: где пригодятся малые языковые модели и что учесть

Опубликовано: 2026-09-27 · Автор: AI Release · @ai_release1
SLM: где пригодятся малые языковые модели и что учесть

⚡ Главное за 5 секунд - SLM — это модели размером от нескольких миллионов до 10 млрд параметров, которые можно запускать на потребительском железе. - Основные примеры: Qwen3.5-0.8B, семейство Gemma (2–9B), Gemini Nano-1 (1.8B) и Nano-2 (3.25B), а также Phi-4 14B от Microsoft. - Ограничение: у SLM своя ниша — узкие задачи и агентские системы, а не замена LLM. ### 🔍 Что обнаружено Малые языковые модели привлекают внимание из-за низких требований к ресурсам. В индустрии нет единого определения: в NVIDIA предлагают считать SLM всё, что работает на персональных компьютерах и ноутбуках. По мере роста возможностей устройств граница размывается — например, Microsoft называет Phi-4 14B малой моделью, потому что её квантованная версия помещается на одну потребительскую видеокарту. По данным летнего отчёта Hugging Face, на модели с более чем 100 млрд параметров приходится лишь 1% загрузок, а на модели менее 1 млрд — около 83%. SLM уже используют на практике. В Колледже Джона Эббота в Монреале развернули связку из трёх моделей (Llama3.2-3B, Qwen2.5-7B, Neural-Chat 7B) на сервере с macOS без топовых GPU — система помогает преподавателям физики проверять лабораторные работы. Пока колледж ограничился промпт-инжинирингом, но дообучение можно сделать дёшево: метод LoRA адаптирует модель под стиль и предметную область с помощью дополнительного набора параметров, а в некоторых случаях такое дообучение обходится всего в восемь долларов. ### 💡 Почему это важно SLM эффективны в узкоспециализированных сценариях, где важна скорость, например при классификации звонков или фильтрации спама. Однако их использование требует продуманной инфраструктуры — часто модели работают в конвейере или под управлением оркестратора. Как отмечает Data Scientist ВТБ Максим Шкут, наиболее вероятный сценарий — агентские системы, где «мозг-оркестратор» распределяет задачи между узкими моделями. При этом не обязательно брать разных вендоров: можно дообучить одну базовую модель под разные задачи, комбинируя LoRA-адаптеры и полное обучение. ### 🧩 Контекст Практическую пользу SLM подтверждают эксперименты. В NVIDIA дообучили Llama 3 8B Instruct с помощью LoRA для внутреннего код-ревью, используя примеры от модели-учителя GPT-4 по схеме дистилляции знаний: точность оценки критичности замечаний выросла более чем на 18%, что оказалось лучше, чем у Llama 3 70B и Nemotron 4 340B Instruct, при меньшей стоимости и задержке. Венгерский университет имени Лоранда Этвеша протестировал 12 моделей от 0,5 до 8 млрд параметров на трёх тысячах Python-программ из бенчмарка APPS: по одной инструкции провести рефакторинг без новых библиотек модели сократили нарушения PEP-8 на 65–86%. Похожий эксперимент в 2024 году провели исследователи из Университета Конкордия и Политехнической школы Монреаля. При этом специфику SLM можно не зашивать в веса, а выносить в «обвязку» — контекст или локальную базу знаний, что упрощает развёртывание.

🔗 Читать на habr.com

🤖 Кратко для ИИ
SLMLLMмашинноеLoRAкод-ревью
📖
Читать гайд по теме
Читать →
← ПредыдущаяЛокальные нейросети без Python и CUDA: Ollivo на Vulkan обгоняет CUDAСледующая →Искусственное воодушевление: почему ИИ-магазин за два вечера — это только начало

Источник: habr.com · пост в Telegram