ИИ‑станция под Gemma 4 31B — полный контекст 256K
Задача: Gemma 4 31B в формате q8 с полным окном в 256 тысяч токенов, рядом — быстрый автокомплит класса Qwen2.5-Coder-7B. Работа командой.
Один сеанс с полным окном занимает 48–59 ГБ видеопамяти: веса 33,5 ГБ плюс память контекста — 11 ГБ в сжатом виде или 22 ГБ в полной точности. Есть два пути.
Купить станцию. Карта на 96 ГБ (RTX PRO 6000 Blackwell, ≈1,0–1,15 млн ₽) закрывает запрос целиком и оставляет запас на второй сеанс. Дешевле — 64 ГБ из двух RTX 5090 (≈0,6–0,7 млн ₽) или 48 ГБ на модифицированной 4090 (≈0,25–0,4 млн ₽, без гарантии). Автокомплит выносится на отдельную карту за ≈50 тыс ₽, чтобы подсказки не ждали большую модель. Станция целиком — примерно 1,2–1,5 млн ₽.
Арендовать GPU в российском облаке. A100 на 80 ГБ — от ≈212 ₽/час с посекундной тарификацией: рабочий день обходится в ≈25–40 тыс ₽/мес, круглосуточная работа — ≈150 тыс ₽/мес. На одной такой карте помещаются и Gemma с полным окном, и автокомплит. Начать можно сегодня без вложений; при постоянной командной нагрузке покупка окупается за 8–10 месяцев, при дневном режиме аренда выгоднее еще около трех лет.
Данные: на своей станции они не покидают офис; при аренде уходят на серверы провайдера (в России) — чувствительное закрывается фильтром обратимого обезличивания: наружу идут подмененные имена и реквизиты, словарь замен остается у вас.
Откуда числа
Видеопамять складывается из весов, памяти контекста и рабочих буферов.
Веса: 31 млрд параметров в q8 — 33,5 ГБ, константа.
Память контекста (KV-кэш) растет с окном. У Gemma 4 шестьдесят слоев: пятьдесят скользящих с окном 1024 и десять глобальных, у которых ключи и значения объединены. На 262 144 токена глобальные слои занимают 21,5 ГБ в полной точности или 10,7 ГБ в q8; скользящие добавляют меньше гигабайта. Каждый параллельный сеанс несет свой контекст — при командной работе именно контекст, а не веса, определяет размер парка.
Буферы — 2–4 ГБ.
Один сеанс: 33,5 + 22,3 + 3 ≈ 59 ГБ в полной точности контекста, ≈48 ГБ в q8.
Покупка
| Видеопамять | Состав | Что дает | Цена карт |
|---|---|---|---|
| 96 ГБ | 1× RTX PRO 6000 Blackwell | 256K в полной точности + запас (2-й сеанс или автокомплит рядом) | 0,95–1,14 млн ₽ |
| 64 ГБ | 2× RTX 5090 32 ГБ | 256K со сжатым KV свободно; с полным — впритык | ≈0,6–0,7 млн ₽ |
| 48 ГБ | 1× 4090 48 ГБ (мод) | один сеанс, только сжатый KV, без гарантии | ≈0,25–0,4 млн ₽ |
| +16 ГБ | RTX 5060 Ti 16 ГБ | автокомплит изолированно | ≈0,05 млн ₽ |
Платформа под любой вариант — 128–256 ГБ DDR5, PCIe5 x16 на карту, блок питания 1600 Вт, два NVMe по 4 ТБ — еще 0,2–0,3 млн ₽.
Аренда в российском облаке
Почасовые цены июля 2026, immers.cloud — тарификация посекундная, вход от 100 ₽ предоплаты:
| Карта | Память | ₽/час | Полное окно 256K |
|---|---|---|---|
| A100 | 80 ГБ | от 212 | да, в полной точности; рядом встает автокомплит |
| H100 | 80 ГБ | от 342 | да, быстрее A100 |
| 2× RTX 5090 | 64 ГБ | от 262 | да, со сжатым KV свободно |
| 2× RTX 3090 | 48 ГБ | от 134 | только сжатый KV, без запаса |
У Selectel лендинг цен не публикует — расчет в их калькуляторе; каталожный ориентир A100 80 ГБ — от 188 ₽/час, на странице заявлена скидка −21% на A100.
Месяц A100 80 ГБ: у immers.cloud дневной режим (8 часов × 22 дня) ≈ 37 тыс ₽, круглосуточно ≈ 152 тыс ₽; у Selectel по ориентиру 188 ₽/час — ≈ 33 тыс и ≈ 135 тыс ₽ (сверить в калькуляторе при заказе). Против станции за 1,2–1,5 млн ₽ это значит: при круглосуточной командной нагрузке покупка окупается за 8–11 месяцев, при дневной — за 32–45. Практичный порядок: начать с аренды, замерить реальную нагрузку, покупать под неё.
Данные и обезличивание
На своей станции данные не покидают офис — главный аргумент покупки.
При аренде вычисления идут в дата-центре провайдера. Серверы перечисленных провайдеров стоят в России — требование 152-ФЗ о базах данных на территории РФ соблюдается. Но это всё же чужие серверы, поэтому чувствительное — имена, реквизиты, коммерческая тайна — закрывается фильтром обратимого обезличивания: наружу уходят подмененные значения, словарь замен остается у вас, ответ восстанавливается обратно; неразрешенная подмена останавливает выдачу. Фильтр собирается из открытых компонентов — Presidio плюс правила для русских реквизитов — и работает на обычном процессоре, без видеокарты.
Команда
На своей станции токены не тарифицируются — расход нулевой при любом объеме работы; в аренде платится время сервера, не токены. Масштаб задает число параллельных сеансов: каждый полный контекст добавляет 11,2 ГБ в q8 или 22,3 ГБ в полной точности. Карта на 96 ГБ держит модель и два полных или пять сжатых сеансов; команде больше — вторая карта, вторая станция или облачный сервер рядом. Модель раздает сервер vLLM — стандартный API, к которому подключаются привычные инструменты, сразу на все рабочие места.
Скорость
Скорость вывода упирается в пропускную способность памяти: на картах с 1792 ГБ/с (PRO 6000, 5090) — реально 35–45 токенов в секунду. Первое прочтение полного 256K-контекста занимает две-три минуты и происходит один раз — прочитанное кэшируется.
Автокомплит
Qwen2.5-Coder-7B q8 занимает 8,1 ГБ весов и до 12 ГБ с контекстом и батчем — своя карта на 16 ГБ или угол арендованной A100. Отдельная карта нужна не ради памяти, а ради скорости отклика: подсказки должны приходить мгновенно, не стоя в очереди, пока большая модель читает свой длинный контекст.
Сегодняшний уровень «7B-автокомплита» — Qwen3-Coder-30B-A3B: качество модели на 30 млрд параметров при скорости трехмиллиардной — на каждом шаге работает лишь малая часть весов. Родное окно 256K, в сжатии Q4 — 19 ГБ. Встает на карту 24–32 ГБ, если нужен автокомплит сильнее.
Проверить при закупке
Поддержку объединенных ключей-значений глобальных слоев Gemma 4 в выбранном сервере (vLLM, llama.cpp): без неё память контекста глобальных слоев удваивается — плюс 10,7 ГБ в q8 или плюс 21,5 в полной точности — и 48-ГБ конфигурация перестает держать 256K.
Для кодовых задач на том же железе Qwen3-Coder-30B-A3B дает качество кода не ниже при десятикратной скорости — один парк обслуживает обе модели.