Локальная нейросеть на телефон означает, что модель живёт в памяти самого устройства и отвечает без обращения к серверу: так работает офлайн, а тексты остаются на аппарате. Платой служат скромные возможности: смартфон ограничен памятью, нагревом и батареей, поэтому подходят лишь небольшие сжатые модели и простые задачи. Что именно получится на вашем телефоне, заранее надёжно ответить нельзя, и единственный честный ответ даёт тест на конкретном устройстве с вашими задачами.
Что реально
На телефоне работают небольшие сжатые модели для простых задач. Производительность зависит от конкретного аппарата и меняется между моделями, поэтому решение принимается по собственному тесту, обещания производителей в расчёт брать нельзя.
По справке Google о запуске моделей на устройстве, платформа Google для запуска моделей на устройстве (Edge) позволяет запускать одну и ту же языковую модель на Android, iOS, в браузере и во встроенных устройствах, используя процессор, графический ускоритель или специализированный нейропроцессор там, где он есть. Для пробы без разработки предусмотрено приложение-галерея на Android и iOS. Это показывает, что направление живое, но о вашей задаче молчит, и пробовать придётся самим.
Прежде чем начинать, определите смысл затеи: зачем модели жить на телефоне. Причины бывают разные: нужен доступ без сети в поездках и на объектах, важно, чтобы тексты оставались на устройстве, или требуется мгновенный отклик без задержки на передачу данных. От причины зависит, насколько допустимы компромиссы по качеству.
| Ограничение | Что это значит на практике | Как проверить |
|---|---|---|
| Память устройства | Модель и рабочий контекст должны помещаться вместе с системой и приложениями | Сверить размер файла модели со свободной памятью |
| Нагрев и батарея | Долгая работа греет аппарат и быстро расходует заряд | Запустить серию запросов и понаблюдать |
| Скорость | Зависит от модели, сжатия и железа | Замерить время ответа на своих запросах |
| Качество | Малые модели чаще ошибаются и слабее держат длинный контекст | Прогнать набор своих задач |
| Парк устройств | У сотрудников разные телефоны | Проверить на самом слабом из рабочих |
Для сравнения: запуск на компьютере описан в статье Ollama на Windows: как сотруднику запустить локальную модель, а о встроенной в устройство модели Google читайте в материале Gemini Nano: модель на устройстве.
Размер модели
Размер файла — главный практический фильтр. Крупные модели выходят за пределы памяти, а подходящие по размеру уступают в качестве. Выбор строится на компромиссе, и его определяет тест, рекомендации из интернета тут слабая опора.
Подбирая модель, игнорируйте громкие названия и читайте карточку: размер файла, язык, лицензия, назначение. Лицензия определяет, можно ли использовать модель в коммерческой работе, и эту проверку делают до установки на телефоны сотрудников. Для русскоязычных задач особенно важно, чтобы модель умела этот язык, иначе качество окажется ниже ожидаемого.
- Малые модели помещаются на большинство современных телефонов, но справляются лишь с простыми задачами: короткие ответы, классификация, переформулировка.
- Сжатие уменьшает файл и потребление памяти, но снижает качество, особенно на русском языке и в редких темах; о квантизации читайте в глоссарии.
- Контекст, то есть объём текста, который модель держит в голове, на телефоне невелик: длинные документы разбивайте.
- Узкая специализация побеждает: небольшая модель под одну задачу часто работает лучше универсальной.
- Версии моделей быстро сменяются, поэтому набор для проверки обновляйте регулярно.
Платформа предоставляет и инструмент для оптимизации моделей, а для типовых задач машинного зрения вроде размытия фона и обнаружения объектов есть готовые интерфейсы, которые работают заметно легче языковых моделей. Если ваша задача из этой области, проверьте их до того, как браться за языковую модель.
Тест на устройстве
Тест строится на реальных задачах и реальном устройстве. Лабораторные цифры производителей говорят о других условиях, а сотрудники пользуются своими телефонами.
- Выберите два-три типичных телефона из тех, что реально есть у сотрудников, включая самый слабый.
- Сформулируйте задачи: что именно модель должна делать на телефоне, в каком виде и на каком языке.
- Подготовьте набор запросов и ожидаемых ответов, как для любого теста качества.
- Установите приложение для проб и загрузите небольшую модель, записав её название и размер.
- Выполните набор и запишите время ответа, расход заряда, нагрев и качество результата.
- Повторите на другой модели или с другим сжатием и сравните.
- Запишите вывод: какая модель на каком устройстве допустима, а какая нет.
Тест на самом слабом телефоне важен потому, что решение действует для всех сотрудников: если задача вытягивается лишь на дорогих аппаратах, это ограничение нужно записать. Проверку качества ответов проводите на русскоязычных примерах из вашей работы, как описано в статье LM Studio GGUF: импорт модели и проверка весов.
Какие задачи вашей команды хотелось бы решать на телефоне без интернета?
Офлайн и приватность
Главный довод в пользу телефона: данные остаются на устройстве, а работа возможна без сети. Оба довода верны, но с оговорками, которые нужно знать до того, как обещать их сотрудникам или клиентам.
Утверждение «данные остаются на устройстве» допускается к использованию только после проверки конкретного приложения: куда оно отправляет сведения, что пишет в журналы, где хранит историю. Приватность определяется приложением целиком, одной локальной работы модели для неё мало.
Проверить сетевую активность приложения можно простым способом: включить режим полёта после загрузки модели и посмотреть, продолжает ли оно работать. Если приложение зависит от сети для обычных ответов, перед вами обычный облачный сервис с красивым названием, локальной моделью его считать нельзя.
- Приложение может отправлять статистику и копии запросов на сервер независимо от модели: прочитайте политику и проверьте сетевую активность.
- История чатов хранится на телефоне, и потерянный или украденный аппарат раскрывает её: нужны блокировка экрана и шифрование.
- Резервные копии устройства могут увязывать историю с облаком, и для рабочих чатов её лучше отключить.
- Загрузка модели требует сети один раз, а затем работа возможна офлайн, но обновления снова обращаются к серверу.
- Персональные данные клиентов обрабатываются по правилам компании, и порядок согласуется с юристом.
Общие принципы локальной обработки конфиденциальных данных описаны в статье локальный ИИ для конфиденциальных данных.
Какие задачи
Телефон хорош там, где важны скорость доступа, офлайн и личный контекст. Он слаб там, где нужны глубокие рассуждения, длинные документы и высокая точность.
- Подходят: короткие заметки и переформулировка текстов, быстрый перевод фраз, голосовые заметки в текст, простая классификация, подсказки при вводе.
- Подходят с оговорками: краткий пересказ небольших фрагментов, ответы по маленькому набору справочных текстов.
- Слабо подходят: анализ больших документов, юридические и финансовые расчёты, любые задачи, где ошибка дорого стоит.
- Лучше на сервере: общая работа с корпоративной базой знаний и сложные ассистенты, о которых читайте в статье компьютер для нейросетей в компании: что нужно для локальной модели.
Если уверенности в силах телефона нет, переместите задачу на рабочий компьютер или собственный сервер: там модели крупнее, а контроль проще. Для выбора схемы под ваши процессы, с данными, устройствами и тестами, мы готовим решение в рамках консалтинга по внедрению ИИ. Гарантии производительности без теста на ваших устройствах исключены.