Локальные нейросети без Python и CUDA: Ollivo на Vulkan обгоняет CUDA
Опубликовано: 2026-09-27 · Автор: AI Release · @ai_release1
⚡ Главное за 5 секунд - Ollivo — Windows-приложение для запуска локальных нейросетей как обычной программы: поставил, выбрал модель, пишешь. Интернет нужен только чтобы скачать модель. - Доступна ранняя версия 0.3, код открыт. Движки llama.cpp, whisper.cpp и ComfyUI ставятся и чинятся сами, программа сама обновляется. - Ограничение: картинок в окне пока нет — это следующая большая версия. Производительность Vulkan на RTX автор пока не проверял. ### 🔍 Что обнаружено Автор WufCorp 27 сентября опубликовал на Habr кейс о разработке Ollivo. Тестовый компьютер — GTX 1080 на 8 ГБ и 32 ГБ оперативной памяти. На Qwen2.5 3B он сравнил сборки llama.cpp: CUDA 12 показала 52 ток/с при архиве 242 + 373 МБ, CUDA 13 — 143 + 403 МБ и «падает», а Vulkan — 30 МБ и 81 ток/с. Vulkan генерирует в полтора раза быстрее CUDA, весит в двадцать раз меньше и не требует библиотек CUDA. При этом длинный запрос он читает медленнее, поэтому для чата по умолчанию выбран Vulkan, а CUDA-сборка подключается по поколению видеокарты. Встроенный «светофор» оценивает скорость ещё до скачивания модели. Для файла GGUF на диске читается заголовок: архитектура, число слоёв, сжатие, размер контекста. Для моделей из каталога оценка грубее: к весам добавляется 700 МБ плюс восьмая часть их размера. Скорость считается от пропускной способности видеопамяти: примерно 60% делится на размер модели. Для Llama 3.1 8B Q4 на GTX 1080 выходит около 37 ток/с — близко к реальности. У MoE-моделей скорость считается по работающей части весов, иначе модель на 35 миллиардов параметров выглядела бы вчетверо медленнее. Если выходит меньше трёх токенов в секунду, программа сообщает об этом до загрузки. ### 💡 Почему это важно Ollivo на практике показывает: для локальных нейросетей CUDA не обязательна. Vulkan-сборка llama.cpp работает на старых картах Pascal, где CUDA 13 не запускается, и при этом оказывается быстрее. Для обычного пользователя это снимает главный барьер: не нужно ставить Python, разбираться с CUDA, выбирать между Q4_K_M и Q5_K_S. Программа сама находит уже скачанные модели в LM Studio, Ollama или ComfyUI и не копирует их — экономия десятков гигабайт. В окне нет слова «токены»: скорость показана в словах в секунду и сравнивается со скоростью чтения, а память разговора считается в страницах. Вместо «Q4_K_M» написано «обычный выбор: почти как оригинал, а места вдвое меньше». ### 🧩 Контекст Автор взялся за проект, потому что сам прошёл через Python, CUDA, torch именно под свою видеокарту и виртуальное окружение, которое ломается при переименовании папки. Вторая причина — люди вокруг него не обязаны знать слова «квантизация», «контекст» и «сэмплер». Третья — всё разбросано по разным программам: текст в LM Studio или Ollama, картинки в ComfyUI, распознавание речи отдельно. Главное правило проекта: если что-то нельзя объяснить одной понятной фразой, в простой режим оно не попадает. Оболочка написана на Tauri 2 и React, ядро — на Rust; установщик около 10 МБ вместо ~150 МБ у Electron. Python нужен только для картинок и ставится по запросу. Модели не копируются, а файлы pickle программа не открывает из-за риска исполняемого кода.