О команде
AI Research Division KRAFTON исследует generative AI, multimodal AI, LLM и другие современные технологии и превращает их в core AI technologies для игр и сервисов. MLSys & Ops Team проектирует, строит и эксплуатирует GPU-инфраструктуру для разработки моделей: training/experiment environments, GPU clusters, infrastructure automation и observability.
Роль — senior hands-on engineer, который будет развивать уже развёрнутую GPU Infrastructure на базе 125 узлов B300 в стабильную и эффективную GPU Platform для research/development teams.
Миссия
- Повышать стабильность, производительность, resource efficiency и automation B300 125-node GPU Infrastructure.
- Проектировать и эксплуатировать Kubernetes-based ML/GPU Platform: scheduling, multi-tenancy, workload isolation, quotas, observability и incident response.
- Улучшать GPU utilization, queue time, throughput и cost efficiency с учётом особенностей training/inference workloads.
- Развивать reproducible ML Platform operations и согласовывать требования нескольких research/development organizations как требования общей платформы.
Обязательные требования
KRAFTON не ожидает знания абсолютно всего, а ищет глубокую экспертизу хотя бы в ключевых областях AI/ML infrastructure.
- Практический опыт улучшения operations для ML/GPU Platform.
- Опыт непосредственного улучшения scheduling, workload isolation, observability и incident response.
- Способность анализировать failures/performance issues на уровне всей системы и доводить расследование до root-cause fixes и structural improvements.
- Опыт сбора требований от research/development teams и предложения technical alternatives и priorities для общей ML/GPU infrastructure.
- Опыт применения generative AI, LLM tools, code assistants и других AI-инструментов для повышения эффективности operations, troubleshooting, documentation и automation.
- Возможность зарубежных командировок.
Будет преимуществом
- Построение/эксплуатация/оптимизация B200/B300, H100/H200, GB200/GB300 или сопоставимых GPU architectures.
- Анализ и оптимизация GPU communication в NCCL, RDMA, RoCE, InfiniBand.
- Distributed storage: Ceph, MinIO и оптимизация data throughput для AI training workloads.
- GPU resource allocation, scheduling, priority и cost/performance optimization.
- NVIDIA GPU Operator, DCGM, MIG/MPS, Run:ai, Slurm, Kueue, Volcano.
- Улучшение distributed-training throughput и GPU utilization через оптимизацию data loading, communication bottlenecks и scheduling.
Найм и условия
Процесс: application review → assignment → Personality Assessment → Technical Fit Interview → 2–3 Culture Fit interviews → offer. Требуются application, cover letter, career description, transcript и обязательное portfolio. Место работы — Yeoksam Centerfield West Tower. Занятость — permanent. Применяется 5-месячный probation.
Отклик принимает студия на своём сайте. LOOTWORK только показывает вакансию.