ИИ‑станция под Gemma 4 31B — полный контекст 256K

Задача: Gemma 4 31B в формате q8 с полным окном в 256 тысяч токенов, рядом — быстрый автокомплит класса Qwen2.5-Coder-7B. Работа командой.

Один сеанс с полным окном занимает 48–59 ГБ видеопамяти: веса 33,5 ГБ плюс память контекста — 11 ГБ в сжатом виде или 22 ГБ в полной точности. Есть два пути.

Купить станцию. Карта на 96 ГБ (RTX PRO 6000 Blackwell, ≈1,0–1,15 млн ₽) закрывает запрос целиком и оставляет запас на второй сеанс. Дешевле — 64 ГБ из двух RTX 5090 (≈0,6–0,7 млн ₽) или 48 ГБ на модифицированной 4090 (≈0,25–0,4 млн ₽, без гарантии). Автокомплит выносится на отдельную карту за ≈50 тыс ₽, чтобы подсказки не ждали большую модель. Станция целиком — примерно 1,2–1,5 млн ₽.

Арендовать GPU в российском облаке. A100 на 80 ГБ — от ≈212 ₽/час с посекундной тарификацией: рабочий день обходится в ≈25–40 тыс ₽/мес, круглосуточная работа — ≈150 тыс ₽/мес. На одной такой карте помещаются и Gemma с полным окном, и автокомплит. Начать можно сегодня без вложений; при постоянной командной нагрузке покупка окупается за 8–10 месяцев, при дневном режиме аренда выгоднее еще около трех лет.

Данные: на своей станции они не покидают офис; при аренде уходят на серверы провайдера (в России) — чувствительное закрывается фильтром обратимого обезличивания: наружу идут подмененные имена и реквизиты, словарь замен остается у вас.

Откуда числа

Видеопамять складывается из весов, памяти контекста и рабочих буферов.

Веса: 31 млрд параметров в q8 — 33,5 ГБ, константа.

Память контекста (KV-кэш) растет с окном. У Gemma 4 шестьдесят слоев: пятьдесят скользящих с окном 1024 и десять глобальных, у которых ключи и значения объединены. На 262 144 токена глобальные слои занимают 21,5 ГБ в полной точности или 10,7 ГБ в q8; скользящие добавляют меньше гигабайта. Каждый параллельный сеанс несет свой контекст — при командной работе именно контекст, а не веса, определяет размер парка.

Буферы — 2–4 ГБ.

Один сеанс: 33,5 + 22,3 + 3 ≈ 59 ГБ в полной точности контекста, ≈48 ГБ в q8.

Покупка

ВидеопамятьСоставЧто даетЦена карт
96 ГБ1× RTX PRO 6000 Blackwell256K в полной точности + запас (2-й сеанс или автокомплит рядом)0,95–1,14 млн ₽
64 ГБ2× RTX 5090 32 ГБ256K со сжатым KV свободно; с полным — впритык≈0,6–0,7 млн ₽
48 ГБ1× 4090 48 ГБ (мод)один сеанс, только сжатый KV, без гарантии≈0,25–0,4 млн ₽
+16 ГБRTX 5060 Ti 16 ГБавтокомплит изолированно≈0,05 млн ₽

Платформа под любой вариант — 128–256 ГБ DDR5, PCIe5 x16 на карту, блок питания 1600 Вт, два NVMe по 4 ТБ — еще 0,2–0,3 млн ₽.

Аренда в российском облаке

Почасовые цены июля 2026, immers.cloud — тарификация посекундная, вход от 100 ₽ предоплаты:

КартаПамять₽/часПолное окно 256K
A10080 ГБот 212да, в полной точности; рядом встает автокомплит
H10080 ГБот 342да, быстрее A100
2× RTX 509064 ГБот 262да, со сжатым KV свободно
2× RTX 309048 ГБот 134только сжатый KV, без запаса

У Selectel лендинг цен не публикует — расчет в их калькуляторе; каталожный ориентир A100 80 ГБ — от 188 ₽/час, на странице заявлена скидка −21% на A100.

Месяц A100 80 ГБ: у immers.cloud дневной режим (8 часов × 22 дня) ≈ 37 тыс ₽, круглосуточно ≈ 152 тыс ₽; у Selectel по ориентиру 188 ₽/час — ≈ 33 тыс и ≈ 135 тыс ₽ (сверить в калькуляторе при заказе). Против станции за 1,2–1,5 млн ₽ это значит: при круглосуточной командной нагрузке покупка окупается за 8–11 месяцев, при дневной — за 32–45. Практичный порядок: начать с аренды, замерить реальную нагрузку, покупать под неё.

Данные и обезличивание

На своей станции данные не покидают офис — главный аргумент покупки.

При аренде вычисления идут в дата-центре провайдера. Серверы перечисленных провайдеров стоят в России — требование 152-ФЗ о базах данных на территории РФ соблюдается. Но это всё же чужие серверы, поэтому чувствительное — имена, реквизиты, коммерческая тайна — закрывается фильтром обратимого обезличивания: наружу уходят подмененные значения, словарь замен остается у вас, ответ восстанавливается обратно; неразрешенная подмена останавливает выдачу. Фильтр собирается из открытых компонентов — Presidio плюс правила для русских реквизитов — и работает на обычном процессоре, без видеокарты.

Команда

На своей станции токены не тарифицируются — расход нулевой при любом объеме работы; в аренде платится время сервера, не токены. Масштаб задает число параллельных сеансов: каждый полный контекст добавляет 11,2 ГБ в q8 или 22,3 ГБ в полной точности. Карта на 96 ГБ держит модель и два полных или пять сжатых сеансов; команде больше — вторая карта, вторая станция или облачный сервер рядом. Модель раздает сервер vLLM — стандартный API, к которому подключаются привычные инструменты, сразу на все рабочие места.

Скорость

Скорость вывода упирается в пропускную способность памяти: на картах с 1792 ГБ/с (PRO 6000, 5090) — реально 35–45 токенов в секунду. Первое прочтение полного 256K-контекста занимает две-три минуты и происходит один раз — прочитанное кэшируется.

Автокомплит

Qwen2.5-Coder-7B q8 занимает 8,1 ГБ весов и до 12 ГБ с контекстом и батчем — своя карта на 16 ГБ или угол арендованной A100. Отдельная карта нужна не ради памяти, а ради скорости отклика: подсказки должны приходить мгновенно, не стоя в очереди, пока большая модель читает свой длинный контекст.

Сегодняшний уровень «7B-автокомплита» — Qwen3-Coder-30B-A3B: качество модели на 30 млрд параметров при скорости трехмиллиардной — на каждом шаге работает лишь малая часть весов. Родное окно 256K, в сжатии Q4 — 19 ГБ. Встает на карту 24–32 ГБ, если нужен автокомплит сильнее.

Проверить при закупке

Поддержку объединенных ключей-значений глобальных слоев Gemma 4 в выбранном сервере (vLLM, llama.cpp): без неё память контекста глобальных слоев удваивается — плюс 10,7 ГБ в q8 или плюс 21,5 в полной точности — и 48-ГБ конфигурация перестает держать 256K.

Для кодовых задач на том же железе Qwen3-Coder-30B-A3B дает качество кода не ниже при десятикратной скорости — один парк обслуживает обе модели.