Jeff: дома обученная 0.8B-модель для быстрых решений за десятки миллисекунд
Опубликовано: 2026-09-29 · Автор: AI Release · @ai_release1
⚡ Главное за 5 секунд - Jeff — открытая 0.8B «System 1»-модель для быстрых решений; на NVIDIA GPU ответ занимает десятки миллисекунд (порядка ~30 мс). - Доступна в версии v1.3: новая adapter-first база, 15 адаптеров, GGUF-файлы для llama.cpp и сборка Jeff-Code; веса на Hugging Face, документация на jeffhub.ai. - Ограничение: адаптеры v1.3 работают только с базой v1.3; часть адаптеров (sanctions, soc) распространяется по CC BY-NC 4.0, у aml и trading-desk свои условия данных. ### 🔍 Что обнаружено Jeff — это открытая 0.8B «System 1»-модель, по анонсу обученная дома и заявленная как Jev-совместимая. Её ключевая идея — поставить перед большой моделью вроде Qwen 3.8-27B: Jeff принимает быстрые решения, а 27B подключается, только если Jeff не уверен. На восьми адаптерах с одинаковыми тестовыми строками средняя точность растёт с 86.6% у одной Qwen до 94.6% у связки Jeff+адаптер и 95.0% при фолбэке на Qwen. Время решения на Apple M4 Max падает с 8.1 с до 0.25 с (35× быстрее) и до 0.46 с (28× быстрее) соответственно. По памяти: Qwen занимает 28.6 ГБ, добавка Jeff со всеми 15 адаптерами — +2.09 ГБ, с тремя — +1.83 ГБ; сама база занимает 1.74 ГБ (измерено на RTX PRO 6000). Отдельная сборка Jeff-Code — кодинг-агент на базе Pi с двумя адаптерами для Qwen 3.8-27B. На 1242 парных задачах из шести бенчмарков pass rate почти одинаковый: 62.4% против 62.8% (парная разница −0.2 пункта, 95% интервал от −2.6 до +2.1). При этом каждая задача выполняется в среднем на 47% быстрее — 32% меньше времени; среднее отношение 0.68× от базовой сборки, медиана 0.70×. На SWE-bench Verified — 0.63×, SWE-rebench — 0.66×, Terminal-Bench Pro — 0.64×, Harbor Index — 0.71×; заметного ускорения нет на Terminal-Bench 2.0 (0.96×) и SkillsBench (0.91×). Суммарное время по всем задачам падает на 14% (0.86×). Простое отключение «мышления» у Qwen даёт минус 7.6 пункта качества, так что именно Jeff решает, когда большой модели нужно думать. ### 💡 Почему это важно Практическая польза — экономия времени и памяти при сохранении точности в сценариях с низкой задержкой. Например, задача guard (защита от промпт-инъекций и джейлбрейков): у Qwen 3.8-27B точность 84.0% за 3.9 с, у Jeff с адаптером — 98.7% за 0.07 с. Похожая картина на триаже, выборе инструментов, спаме и навигации: Jeff стабильно даёт 88–99% за 0.07–0.58 с. Это позволяет локально ставить маленькую модель перед агентными сценариями, фильтрацией и маршрутизацией, не держа тяжёлую модель на каждом шаге. ### 🧩 Контекст Jeff v1.3 — это новый adapter-first базовый релиз: 15 адаптеров, каждый обучен одну эпоху, и для каждого на held-out тестах приведены точность и калибровочная ошибка. Например, sanctions-адаптер даёт 99.96% точности, guard — 98.2%, legal-clauses — 83.6% на 100 типах пунктов. Методология в описании зафиксирована: Apple M4 Max 128 ГБ, обе модели на MLX, Qwen 3.8-27B в 8-bit, выборки по 300 строк на задачу (500 для emotion и legal-clauses). Адаптеры v1.2 остаются доступными под старыми именами. По данным Hacker News, пост проекта набрал 287 очков и 117 комментариев, что привлекло внимание к проекту, хотя детальных описаний ограничений в анонсе пока нет.
⚡ Главное за 5 секунд - Jeff — открытая 0.8B «System 1»-модель для быстрых решений; на NVIDIA GPU ответ занимает десятки миллисекунд (порядка ~30 мс).
- Доступна в версии v1.3: новая adapter-first база, 15 адаптеров, GGUF-файлы для llama.cpp и сборка Jeff-Code; веса на Hugging Face, документация на jeffhub.ai.
- Ограничение: адаптеры v1.3 работают только с базой v1.3; часть адаптеров (sanctions, soc) распространяется по CC BY-NC 4.0, у aml и trading-desk свои условия данных.
🔍 Что обнаружено Jeff — это открытая 0.8B «System 1»-модель, по анонсу обученная дома и заявленная как Jev-совместимая.
Её ключевая идея — поставить перед большой моделью вроде Qwen 3.8-27B: Jeff принимает быстрые решения, а 27B подключается, только если Jeff не уверен.
На восьми адаптерах с одинаковыми тестовыми строками средняя точность растёт с 86.6% у одной Qwen до 94.6% у связки Jeff+адаптер и 95.0% при фолбэке на Qwen.
Время решения на Apple M4 Max падает с 8.1 с до 0.25 с (35× быстрее) и до 0.46 с (28× быстрее) соответственно.
По памяти: Qwen занимает 28.6 ГБ, добавка Jeff со всеми 15 адаптерами — +2.09 ГБ, с тремя — +1.83 ГБ; сама база занимает 1.74 ГБ (измерено на RTX PRO 6000).