Каждый раз, когда помощник в телефоне «думает», переписка уезжает на чужой сервер — и за каждый ответ капает счёт. Хочется, чтобы он сам разложил задачу на шаги и вызвал нужные инструменты, но без облачной кассы и без лишней задержки.
Liquid AI выпустила компактную модель LFM2.5: она крутится на телефоне, сама планирует работу и зовёт инструменты — ответ модели не едет в облако. Памяти нужно меньше двух с половиной гигабайт, на телефоне ответ идёт без облачной очереди. Для сложного кода и тяжёлых справок крупные облачные модели всё ещё сильнее; зато локальный помощник уже можно держать у себя без счёта за каждый чих.
Агент с планом на телефоне перестал быть лабораторной игрушкой

Речь не про «ещё одну маленькую нейросеть для чата». Liquid AI выложила LFM2.5-2.6B — плотную модель на 2,6 миллиарда параметров, заточенную под агентную работу: план, многошаговая задача, вызов инструментов. Ответ модели считается целиком на устройстве. Облачный API для этого не нужен. После скачивания вендор обещает бесплатный прогон у себя, низкую задержку и то, что переписка не уезжает на чужой сервер ради каждого токена.
Публичный анонс — в блоге Liquid AI; подробности и те же цифры продублированы в блоге Hugging Face от 4 августа 2026. В карточке модели на Hugging Face прямо написано, для чего она годится и для чего нет. Это не маркетинговый туман — там же лежат ограничения.
Цифры вендора звучат громко, но их надо читать как заявку

По таблице Liquid: до 220 токенов в секунду на Apple M5 Max, 113 на Ryzen AI Max+ 395, около 30 на телефоне. Память на процессоре — меньше 2,5 гигабайта. Окно контекста — 128 тысяч токенов, словарь тоже расширили до 128 тысяч, в том числе под нелатинские языки; русский в списке языков карточки есть.
Предобучение — порядка 34 триллионов токенов, потом доводка с растягиванием контекста до 128K. Дальше четыре стадии: два круга обучения по инструкциям, специализация учителя по доменам, дистилляция по нескольким доменам и агентное обучение с подкреплением уже внутри живых обвязок вроде Hermes Agent и OpenClaw. Модель не «потом сами прикрутите инструменты» — её доводили там, где эти инструменты реально вызываются.
В вендорских бенчмарках LFM2.5-2.6B лидирует по следованию инструкциям и держится сильно на вызове инструментов: ToolSandbox 77,83, BFCLv4 56,88 — чуть ниже крупного Qwen3.5-9B с 60,13. На агентных задачах обходит Gemma 4 E2B и E4B и ходит рядом с Qwen3.5. Код — зона, где большие модели по-прежнему впереди. Все эти цифры — от производителя, не независимый аудит. Имеет смысл воспринимать их как заявку, а не как приговор рынку.
Где модель помогает, а где лучше не ждать чуда

Hugging Face и документация Liquid рекомендуют модель для агентных нагрузок, вызова инструментов, извлечения данных, поиска по своим текстам и длинного контекста. Не рекомендуют для агентного кодинга и задач, где нужна тяжёлая «энциклопедия в голове». Переписка, разбор писем, черновики, вызов локальных и внешних инструментов по плану — да. Переписать половину репозитория как старший разработчик — нет, для этого по-прежнему берут крупную облачную модель.
Отдельно: «без облака» здесь про ответ самой модели. Если инструмент ходит в веб-поиск или в CRM, сеть всё равно нужна. Локальный прогон — не абсолютный офлайн и не волшебная полная изоляция. Это про то, что токены плана и текста не капают в чужой API по умолчанию.
Локальный сервер и обвязка агента сходятся в одной точке
Практический паттерн из документации Liquid простой. Поднимаете совместимую с OpenAI точку входа на своём железе — llama.cpp, MLX, vLLM, SGLang или ONNX — и указываете обвязке агента этот адрес. Из коробки заявлена работа с Hermes Agent, OpenClaw и Pi.
Для сжатия в GGUF вендор советует стартовать с Q4_K_M — около 1,67 гигабайта. Если агент часто дергает инструменты, безопаснее Q8_0 около 2,87 гигабайта или BF16. В llama.cpp для вызова инструментов нужен флаг —jinja и контекст вроде -c 131072; без jinja «агентная» модель так и останется болтливой болванкой. Порты по умолчанию разные: llama.cpp и MLX — 8080, vLLM — 8000, SGLang — 30000, LM Studio — 1234. У vLLM и SGLang для разбора вызовов инструментов нужен парсер lfm2; у vLLM ещё включают авто-выбор инструмента.
В Hermes без принудительного режима вызова инструментов модель любит описывать действие словами вместо настоящего вызова. В OpenClaw достаточно своего провайдера с адресом http://localhost:8080/v1 и идентификатором модели LFM2.5-2.6B — дальше дашборд OpenClaw. Демо на телефоне внутри обвязки Liquid Agent показывает план, инструменты и задачу без облачных вызовов модели; в обзорах мелькает сценарий вроде планирования свадебной поездки — смысл тот же: шаги и инструменты на устройстве.
Типичный провал выглядит как умная болтовня без дел
Забыли —jinja или парсер lfm2 — инструменты не заведутся, хоть модель и «агентная» на бумаге. В Hermes не включили принуждение к вызову инструментов — получите красивое описание вместо действия. Поставили самый лёгкий квант и удивились, что на задачах с частыми вызовами инструментов модель плывёт. Смешали «нейросеть на телефоне» из магазинов приложений с агентом, который сам планирует и зовёт инструменты: первое чаще про фото и бесплатные фильтры, второе — про другую боль.
И ещё: не путайте официальные 2,6 миллиарда параметров с цифрой 2,69 из вторичных пересказов. Ориентир — блог и документация Liquid AI, карточка на Hugging Face.
Сдвиг уже здесь, но паритета с облачными гигантами ещё нет
Смысл релиза не в том, что карманная модель внезапно обогнала облачных гигантов во всём. Смысл в другом: агент с планом и инструментами на телефоне или на краю сети перестал быть демонстрацией для конференции. Можно параллелить фоновые задачи локально, не глядя на счётчик токенов. Пока крупные модели умнее в коде и в знаниях «обо всём», компактный локальный агент уже закрывает другой слой работы — быстрый, приватный, без облачной кассы на каждый чих.
Если собираете такие связки сами — локальная модель, обвязка агента, автоматизации — загляните в канал «Ковчег» в Telegram и в тот же канал в MAX: там про автоматизацию с нейросетями, Make и Cursor AI. Практика стека Cursor, Make и AI без воды лежит на обучении.