Инженеры и разработчики ИИ-инфраструктуры провели сравнительное исследование производительности нейросети Kimi K3 при развертывании на кластере из 24 вычислительных узлов NVIDIA DGX Spark. В обзоре рассматривается сопоставление различных стратегий параллелизма тензоров и конвейеров для оптимизации пропускной способности при высокой рабочей нагрузке.
При масштабировании крупных языковых моделей (LLM) уровня Kimi K3 ключевым фактором производительности становится правильный выбор топологии параллельных вычислений. На базе комплекса из 24 систем NVIDIA DGX Spark эксперты проанализировали две топологии: чистый тензорный параллелизм TP24 и гибридную схему TP8/PP3 с межсерверными конвейерами.
Сравнительный анализ конфигураций вычислений
В ходе бенчмаркинга сопоставлялись задержка генерации токенов (latency), накладные расходы на межпроцессорное взаимодействие по шине NVLink/NVSwitch и утилизация памяти GPU. Основные характеристики тестируемых режимов:
- Режим TP24: обеспечивает минимальную задержку при генерации единичных последовательностей за счет распараллеливания слоев по всем 24 узлам, однако требователен к пропускной способности сети;
- Гибридный режим TP8/PP3: комбинирует тензорный параллелизм внутри 8-чиповых доменов с конвейерным параллелизмом (Pipeline Parallelism) между 3 группами, что снижает межсерверный трафик;
- Оптимизация распределения памяти VRAM при работе с длинными контекстными окнами.
Результаты бенчмарков и рекомендации
По данным тестирования на форумах разработчиков NVIDIA от 30 июля 2026 года, гибридная конфигурация TP8/PP3 продемонстрировала на 18% более высокую суммарную пропускную способность при обслуживании многопользовательских запросов (high batch size). Схема TP24 оказалась эффективнее в индивидуальных интерактивных задачах, где критична задержка первого токена (TTFT).
Выводы по выбору инфраструктуры
Для развертывания высоконагруженных сервисов на базе Kimi K3 целесообразно использовать гибридное разделение модели. Это позволяет сбалансировать нагрузку на графические процессоры и избежать узких мест сетевой инфраструктуры DGX Spark.
Источники
- NVIDIA Developer Forum, 2026-07-30
