48 ядер Zen 5 с полноценным AVX-512 и 12 каналами DDR5: выгодный выбор для инференса на CPU и CI.
CPU-серверы для ИИ и CI. Серьёзные вычисления без очереди за GPU.
Не каждой задаче ИИ или вычислений нужен GPU. Квантованные языковые модели, эмбеддинги, CI-пайплайны, компиляция и рендеринг отлично работают на множестве современных ядер с широкими векторными блоками — в разы дешевле и без очереди.
- До 64ядер на сокет
- Инструкции AVX-512полной ширины на Zen 5
- AMXна Xeon 6
- $255минимальная цена в месяц
Что нужно этой задачеПрофиль нагрузки
- Широкие векторные блокиZen 5 выполняет AVX-512 на полной 512-битной ширине, а Xeon 6 добавляет матричные ускорители AMX для инференса в BF16 и INT8.
- Пропускная способность памятиГенерация токенов упирается в пропускную способность памяти. У EPYC Turin — 12 каналов DDR5 на сокет.
- Много параллельных задачCI-раннеры, сборочные фермы и рендер-ноды масштабируются почти линейно с числом ядер. 48 или 64 ядра — и очередь сборок уже совсем другая.
- Предсказуемые расходыФиксированная цена в месяц вместо поминутной тарификации: загружайте очередь на полную днём и ночью.
Лучшие выделенные серверы для ИИ и вычислений на CPU
Их выбрали инженеры, которые подбирают серверы под такие задачи каждую неделю. Все они в наличии.
64 ядра Granite Rapids с AMX — лучший вариант на CPU для фреймворков инференса в BF16/INT8, которые его поддерживают.
64 ядра Zen 5 и 256 ГБ для самых больших очередей рендеринга и сборки.
Как настроить сервер для ИИ и вычислений на CPU
Первый час на новом сервере определяет, как пройдёт следующий год.
Где размещать
Для вычислений локация не критична: берите самый дешёвый сервер из наличия рядом с вашими данными. Больше всего EPYC и Xeon в наличии во Франкфурте и Амстердаме.
Сравните задержку для ваших пользователей- Используйте квантованные модели (Q4–Q8) с llama.cpp или ONNX Runtime; число потоков задавайте по физическим ядрам, а не по потокам.
- На Xeon 6 включите AMX во фреймворках, которые его поддерживают (PyTorch с oneDNN, OpenVINO).
- Выделите CI-раннерам собственный tmpfs под каталоги сборки, чтобы поберечь NVMe.
- Трезво оценивайте масштаб: обучение больших моделей по-прежнему удел GPU — мы честно скажем, если это ваш случай.
Вопросы об ИИ и вычислениях на CPU
Клиенты задают вопросы напрямую инженерам, которые обслуживают серверы, — в тикете из личного кабинета. Медианное время первого ответа — менее 15 минут, 24/7.
Как работает техподдержкаУ вас есть серверы с GPU?
Пока нет — наш ассортимент ориентирован на CPU. Для многих задач инференса и пакетной обработки от 48 до 64 современных ядер — более выгодный вариант.
Насколько большую модель можно запустить на CPU?
При 256 ГБ памяти квантованные модели на несколько десятков миллиардов параметров помещаются с запасом; скорость генерации тогда зависит от пропускной способности памяти.
Можно ли запускать CI для множества репозиториев?
Да. Раннеры в контейнерах или виртуальных машинах, каждый со своими лимитами CPU, обслуживают десятки пайплайнов на одном сервере.
