5 июня 2026 года мы добавили в Legalic возможность работать с локальными ИИ-моделями. Теперь ассистент Legalic может отвечать не только через облачных провайдеров, но и через нейросеть, которая запущена прямо на компьютере пользователя.
Главная идея простая: если дело, переписка или документы не должны покидать рабочую машину, Legalic можно подключить к локальному llama-server. В этом режиме запросы уходят на адрес вида http://localhost:8088/v1, а модель считает ответ на вашем компьютере.
Что появилось в Legalic
- Локальный провайдер Llama.cpp / Llama Server. В настройках моделей ИИ можно включить отдельную карточку провайдера, указать Base URL, обновить список моделей и проверить подключение.
- Назначение локальной модели для чата и агентов. После проверки соединения модель можно выбрать в разделе «Назначение моделей» для сценария «Чат и агенты».
- Работа с изображениями и сканами. Если локальная vision-модель запущена с файлом
mmproj, ассистент может принимать прикреплённые изображения в чате и извлекать из них текст. - Переключение между локальными и облачными провайдерами. Локальный ИИ не заменяет GPT, Claude, DeepSeek и другие облачные модели: пользователь выбирает подходящий режим под конкретную задачу.
Зачем это нужно юристу
У юридической работы есть сценарии, где приватность важнее скорости или максимальной «эрудиции» модели: первичный разбор материалов дела, работа с персональными данными, черновики по конфиденциальным документам, распознавание сканов, внутренние заметки по позиции.
Локальная модель полезна именно в таких случаях. Документы и переписка при работе с локальным провайдером не отправляются в облачный ИИ-сервис, API-ключи не нужны, а стоимость не считается по токенам провайдера. Платой за это становится зависимость от мощности компьютера: локальная модель обычно медленнее и слабее самых сильных облачных моделей.
Как это устроено
Legalic сам не загружает файл модели и не запускает нейросеть внутри браузера. Схема состоит из двух частей:
llama-server— локальная программа из проекта llama.cpp, которая загружает модель и принимает запросы на localhost.- Файл модели
.gguf— большой файл с весами нейросети. Для распознавания изображений дополнительно нужен совместимый файлmmproj-*.gguf.
Сначала пользователь запускает llama-server с нужным файлом модели, затем в Legalic указывает адрес сервера и выбирает найденную модель в списке.
Быстрый старт
На Mac проще всего установить движок через Homebrew:
brew install llama.cpp
Затем нужно скачать модель в формате .gguf, например с Hugging Face. Для мультимодального режима, когда ассистент должен видеть изображения и сканы, со страницы той же модели нужно скачать ещё и mmproj. Важно брать проектор именно от этой модели: mmproj от другой размерности или семейства может не подойти.
Пример запуска только для текста:
llama-server \
-m ~/models/gemma-4-12b-it-Q8_0.gguf \
-ngl 99 -c 16384 \
--host 127.0.0.1 --port 8088
Пример запуска с распознаванием изображений:
llama-server \
-m ~/models/gemma-4-12b-it-Q8_0.gguf \
--mmproj ~/models/mmproj-F16.gguf \
-ngl 99 -c 16384 \
--host 127.0.0.1 --port 8088
Сервер готов к работе, когда в терминале появляется сообщение, что он слушает адрес http://127.0.0.1:8088. Окно терминала нужно оставить открытым: пока оно открыто, локальная модель доступна Legalic.
Подключение в Legalic
- Откройте «Настройки → Модели ИИ».
- Включите провайдер «Llama.cpp / Llama Server».
- В поле Base URL укажите
http://localhost:8088/v1. - Нажмите «Обновить список моделей», затем «Проверить подключение».
- В разделе «Назначение моделей → Чат и агенты» выберите провайдер Llama Server и найденную модель.
Распознавание документов в чате
Если сервер запущен с --mmproj, ассистент Legalic может работать с изображениями. В чат можно прикрепить фото или скан документа и попросить извлечь весь текст, найти реквизиты сторон, пересказать содержание, перевести фрагмент или подготовить дальнейший анализ.
Это не классический OCR, который просто читает пиксели. Vision-модель пытается понимать структуру: таблицы, блоки, контекст документа. На чётких сканах результат обычно лучше, на плохих фотографиях и рукописном тексте — менее предсказуемый.
Практические ограничения
llama-serverдержит одну модель за раз. Чтобы переключиться на другой файл.gguf, сервер нужно остановить и запустить заново.- Памяти нужно примерно столько, сколько весит файл модели, плюс запас 2-3 ГБ. Большие модели требуют больше RAM и дискового места.
- Для изображений нужна vision-модель и совместимый
mmproj. Без него сервер будет принимать только текст. - Если ассистент отвечает слишком медленно, лучше взять более лёгкую квантизацию, например
Q4_K_MилиQ5_K_M, и убедиться, что запуск идёт с-ngl 99.
Безопасность
Рекомендуемый запуск с --host 127.0.0.1 делает сервер доступным только с текущего компьютера. Для локального режима это правильная настройка по умолчанию: Legalic обращается к модели на localhost, а документы не уходят к стороннему ИИ-провайдеру.
В результате Legalic теперь закрывает два разных режима работы: облачные модели для задач, где нужна максимальная сила и скорость, и локальные модели для чувствительных материалов, где важнее контроль над данными.