EN

Gemma 4 на сервере: запуск через Ollama или llama.cpp

Опубликовано: 2026-09-30 · Автор: AI Release · @ai_release1
Gemma 4 на сервере: запуск через Ollama или llama.cpp

⚡ Главное за 5 секунд - Статья из блога Selectel сравнивает запуск модели Gemma 4 на сервере с GPU: через Ollama и напрямую через llama.cpp. - Тестовая среда: виртуальная машина с RTX 4090 (24 ГБ), модель — Gemma 4 26B A4B в квантовании Q4_0, вес 14–18 ГБ. - Автор приводит пошаговые инструкции для обоих случаев, но не делает окончательного вывода — решение остаётся за читателем. ### 🔍 Что обнаружено Для тестов в облаке Selectel заказывается VM с GPU, в качестве видеокарты выбрана RTX 4090, а автовыбор образа отвечает за драйверы. Установка Ollama сводится к одной команде curl -fsSL https://ollama.com/install.sh | sh; статус проверяется через systemctl status ollama. Демон по умолчанию слушает 127.0.0.1:11434. CLI напоминает Docker: доступны команды pull, run, rm, ps. Модель с Hugging Face скачивается через ollama pull hf.co/ggml-org/gemma-4-26B-A4B-it-GGUF:Q4_0. Для проверки API используются curl http://localhost:11434/api/tags и POST в /api/chat с "stream": false, чтобы получить единый JSON-ответ. llama.cpp требует сборки из исходников. Устанавливаются git, cmake, build-essential, libssl-dev, проверяется наличие nvcc (nvcc --version) и при необходимости ставится nvidia-cuda-toolkit. После клонирования репозитория выполняется cmake -B build -DGGML_CUDA=ON и сборка с -j$(nproc). Наличие видеокарты проверяется через llama-server --list-devices. Модель загружается командой llama-cli -hf ggml-org/gemma-4-26B-A4B-it-GGUF:Q4_0. Сервер запускается с параметрами --n-gpu-layers all, --ctx-size 4096, --parallel 1, хост 0.0.0.0, порт 8080. API совместим с OpenAI и принимает запросы на http://localhost:8080/v1/chat/completions. ### 💡 Почему это важно Выбор между Ollama и llama.cpp часто превращается в религиозную войну в комментариях. Эта статья полезна тем, что предлагает не абстрактные аргументы, а конкретные шаги: как установить, какую команду выполнить, как проверить API. Читатель может за 10 минут развернуть оба варианта на одной и той же машине с одной моделью и самостоятельно решить, что ему удобнее — скрывающий сложность Ollama или гибкий llama.cpp с ручной сборкой. Такой подход снижает зависимость от чужих мнений и даёт фактуру для собственного выбора. ### 🧩 Контекст Ollama вышла в 2023-м как надстройка над llama.cpp, в 2025-м получила собственный движок для мультимодальных моделей (работает с GGML), а в 2026-м вернулась к llama.cpp для поддержки GGUF. Модель Gemma 4 — полностью открытая (Apache 2.0) разработка Google, появившаяся весной этого года. В тесте используется MoE-вариант 26B A4B: 26 млрд параметров, но активны только ~4 млрд на токен, благодаря чему модель эффективнее по ресурсам. Внутри такой архитектуры есть несколько экспертов, и для каждого запроса задействуется лишь часть, что даёт баланс между качеством ответа и расходом ресурсов.

🔗 Читать на habr.com

🤖 Кратко для ИИ
ollamallama.cppgemmaинференс
📖
Читать гайд по теме
Читать →
← ПредыдущаяПомощник магазина на локальной 9B-модели: разбор кейсаСледующая →Windows 11: какие фоновые службы тормозят ПК и что отключить

Источник: habr.com · пост в Telegram