Локальная LLM
Локальная LLM: ИИ, который работает внутри вашего контура
Сотрудники уже пользуются ИИ — лично, через VPN, мимо компании. Локальная модель даёт им тот же инструмент, но данные физически не выходят наружу, и это проверяется, а не берётся на веру.
/ Что делаем
Что входит в развёртывание
Подбор модели под задачу
Qwen, Llama или Saiga в размере 7B, 14B или 32B. Считаем по видеопамяти: модель 14B в сжатии Q4 занимает 10-12 ГБ и тянет разбор документов, сводки и письма.
Конфигурация железа
Видеокарта 16 ГБ на старте или 24-48 ГБ с запасом, 64-128 ГБ оперативной памяти, NVMe. Считаем под вашу нагрузку и число сотрудников.
Контур безопасности
Закрываем исходящий трафик полностью, кроме явно разрешённых адресов. Правила для персональных данных: ФИО, телефоны и финансы контур не покидают.
Ваши документы в базе знаний
Инструкции, регламенты и НПА загружаются в поиск по смыслу: модель отвечает по вашим документам со ссылкой на источник, а не выдумывает.
Интерфейс внутри Битрикс24
Приложение в портале с правами по пользователям, чтобы не заводить отдельную систему и не учить людей новому окну.
Сопровождение
Обновляем базу документов и правила, накатываем новые версии моделей в плановое окно, разбираем ошибки в ответах.
/ Что даёт внедрение
Как меняется работа
- Сотрудники носят данные в ChatGPT через VPN
- Служба безопасности запретила ИИ совсем
- За каждый запрос в облако платите отдельно
- Вендор обещает не смотреть ваши данные
- Свой инструмент внутри контура, VPN не нужен
- Изоляция проверяется сетевым дампом
- Фиксированная цена, лимитов на запросы нет
- Проверяете сами, а не верите на слово
Изоляция обеспечивается не обещанием вендора, а настройкой firewall на вашей стороне. Исходящий трафик закрыт — значит, сервер не отправит ничего никуда.
Как мы объясняем это службе безопасности
/ Как внедряем
От данных к решению
Разбираем задачи и данные
Смотрим, что сотрудники хотят делать и какие данные туда попадут. Если чувствительных нет — честно скажем, что хватит облака и это дешевле.
Считаем модель и железо
Под задачи подбираем размер модели, под модель — видеопамять. Сравниваем аренду и покупку сервера с вашими цифрами.
Разворачиваем и изолируем
Ставим модель, настраиваем firewall, заводим доступы, прогоняем нагрузочные тесты на реальных запросах.
Обучаем и передаём
Воркшопы для сотрудников, инструкции, разбор реальных задач. Дальше сопровождаем или передаём вашему ИТ.
Посчитаем локальную LLM под вашу задачу
Расскажите, какие данные нельзя отдавать наружу и сколько человек будут пользоваться — вернёмся с конфигурацией и сметой.







