Первый в России сайт с полным циклом ИИСмотрите презентацию ИИ-сайта продажСайт, которым полностью управляет ИИКонтент, реклама, лиды и аналитика — на автопилоте

Локальная LLM

Локальная LLM: ИИ, который работает внутри вашего контура

Сотрудники уже пользуются ИИ — лично, через VPN, мимо компании. Локальная модель даёт им тот же инструмент, но данные физически не выходят наружу, и это проверяется, а не берётся на веру.

Подробнее
0
запросов наружу: сервер не ходит в интернет
3-4 нед
от готовности сервера до рабочей системы
14B
модель, которой хватает для офисных задач
от 10 900 ₽
аренда сервера с видеокартой в месяц

/ Что делаем

Что входит в развёртывание

01

Подбор модели под задачу

Qwen, Llama или Saiga в размере 7B, 14B или 32B. Считаем по видеопамяти: модель 14B в сжатии Q4 занимает 10-12 ГБ и тянет разбор документов, сводки и письма.

02

Конфигурация железа

Видеокарта 16 ГБ на старте или 24-48 ГБ с запасом, 64-128 ГБ оперативной памяти, NVMe. Считаем под вашу нагрузку и число сотрудников.

03

Контур безопасности

Закрываем исходящий трафик полностью, кроме явно разрешённых адресов. Правила для персональных данных: ФИО, телефоны и финансы контур не покидают.

04

Ваши документы в базе знаний

Инструкции, регламенты и НПА загружаются в поиск по смыслу: модель отвечает по вашим документам со ссылкой на источник, а не выдумывает.

05

Интерфейс внутри Битрикс24

Приложение в портале с правами по пользователям, чтобы не заводить отдельную систему и не учить людей новому окну.

06

Сопровождение

Обновляем базу документов и правила, накатываем новые версии моделей в плановое окно, разбираем ошибки в ответах.

/ Что даёт внедрение

Как меняется работа

Было
  • Сотрудники носят данные в ChatGPT через VPN
  • Служба безопасности запретила ИИ совсем
  • За каждый запрос в облако платите отдельно
  • Вендор обещает не смотреть ваши данные
Стало
  • Свой инструмент внутри контура, VPN не нужен
  • Изоляция проверяется сетевым дампом
  • Фиксированная цена, лимитов на запросы нет
  • Проверяете сами, а не верите на слово

Изоляция обеспечивается не обещанием вендора, а настройкой firewall на вашей стороне. Исходящий трафик закрыт — значит, сервер не отправит ничего никуда.

Как мы объясняем это службе безопасности

/ Как внедряем

От данных к решению

01

Разбираем задачи и данные

Смотрим, что сотрудники хотят делать и какие данные туда попадут. Если чувствительных нет — честно скажем, что хватит облака и это дешевле.

02

Считаем модель и железо

Под задачи подбираем размер модели, под модель — видеопамять. Сравниваем аренду и покупку сервера с вашими цифрами.

03

Разворачиваем и изолируем

Ставим модель, настраиваем firewall, заводим доступы, прогоняем нагрузочные тесты на реальных запросах.

04

Обучаем и передаём

Воркшопы для сотрудников, инструкции, разбор реальных задач. Дальше сопровождаем или передаём вашему ИТ.

Посчитаем локальную LLM под вашу задачу

Расскажите, какие данные нельзя отдавать наружу и сколько человек будут пользоваться — вернёмся с конфигурацией и сметой.

/ FAQ

Частые вопросы

Чем локальная LLM отличается от ChatGPT или Битрикс Coworker?

Местом, где живут данные. В облаке вы верите политике вендора, у локальной модели проверяете сами: снимаете сетевой дамп и видите, что исходящих соединений нет. Плюс фиксированная цена вместо оплаты за каждый запрос.

Какая модель нужна для офисных задач?

Обычно 14B: её хватает на сводки, письма, разбор документов и составление ТЗ. Модель 7-8B справляется только с простым переписыванием текста, а 32B и выше нужны для сложного анализа длинных регламентов.

Сколько стоит сервер?

Аренда видеокарты 16 ГБ в российском ЦОД — от 10 900 ₽ в месяц, карта 24 ГБ дороже примерно вдвое. Покупка своего сервера обойдётся в 1,3-1,8 млн ₽ единовременно и окупается около десяти лет, поэтому её выбирают только по требованию безопасности.

Модель будет знать свежие данные?

Знания самой модели зафиксированы на момент выпуска, но для рабочих задач это неважно: она работает с вашими документами, а не с памятью. Если нужны внешние данные, делаем отдельный канал с одним разрешённым адресом — наружу уходит только текст запроса.

Локальная модель врёт меньше?

Нет, выдумывать может любая модель. Снижается это не выбором модели, а тем, что ответ строится по вашим документам со ссылкой на источник — тогда проверка занимает секунды.

Сколько людей смогут работать одновременно?

Карта 16 ГБ тянет 2-3 параллельных запроса, 48 ГБ — до пяти. При 15 активных пользователях запросы встают в очередь на секунды: для офисных задач это нормально, для чат-бота на сайте — нет.

/ Смотрите также

/ Поехали

Обсудим локальную LLM

Расскажите про данные и задачи — предложим модель, конфигурацию сервера и смету.

+7 (495) 320-10-00