Своя нейросеть на сервере: что нужно и сколько это стоит
Главный вопрос не «какую нейросеть выбрать», а «сколько видеопамяти она займёт». От этого зависит железо, а от железа — бюджет. Разбираем по цифрам, без общих слов.
/ Что обеспечиваем
Из чего складывается конфигурация
Размер модели
7-8B тянет простые переформулировки, 14B закрывает сводки, письма и разбор документов, 32B нужна для сложного анализа длинных регламентов. Для офисных задач 70B избыточна.
Сжатие модели
Квантование Q4 сжимает сильно с потерей качества 3-5%, Q8 мягче — около 1%. Модель 14B в Q4 занимает 10-12 ГБ, в Q8 уже 15 ГБ.
Видеокарта
16 ГБ достаточно для старта на модели 14B, 24-48 ГБ берут с запасом под рост. Именно карта определяет, какая модель поместится.
Процессор, память, диск
16+ ядер на подготовку данных и разбор PDF, 64-128 ГБ оперативной памяти, 1-2 ТБ NVMe под модели, индекс документов и логи.
Питание и охлаждение
750-1000 Вт и ИБП: карта под нагрузкой потребляет много. Нужна серверная стойка, офисный шкаф не подойдёт — греется постоянно.
Аренда или покупка
Аренда в ЦОД по 152-ФЗ снимает капитальные затраты и санкционный риск, выдача за 15 минут. Покупка оправдана требованием безопасности, но не экономикой.
/ Что даёт
Как меняется инфраструктура
- Непонятно, какая видеокарта нужна под задачу
- Подрядчики называют цену без обоснования
- Риск купить железо и не угадать с моделью
- Санкционные риски и сроки поставки на вас
- Конфигурация посчитана от задач, а не наугад
- Видно, из чего складывается каждая цифра
- Начинаем с аренды, масштабируемся по факту
- Аренда в российском ЦОД снимает оба риска
При аренде 10 900 ₽ в месяц покупка сервера окупается примерно за десять лет. За это время сменятся три поколения видеокарт.
Почему мы почти всегда советуем аренду
/ Как выстраиваем
Контур надёжности
Считаем от задач
Смотрим, что модель должна уметь и сколько человек будут работать одновременно. Отсюда размер модели и число параллельных запросов.
Подбираем железо
Считаем видеопамять под модель со сжатием, добавляем контекст и запас. Получаем конкретную карту и конфигурацию сервера.
Разворачиваем
Установка, firewall, доступы, нагрузочные тесты на ваших реальных запросах, а не на синтетике.
Сопровождаем
Обновление версий моделей в плановое окно, мониторинг нагрузки, расширение конфигурации при росте.
Посчитаем конфигурацию под вашу задачу
Опишите задачи и число пользователей — вернёмся с моделью, видеокартой и сметой на развёртывание.







