AI Research — направление
AI Research KRAFTON сотрудничает с различными внутренними и внешними направлениями и создаёт AI-решения и собственные сервисы на базе deep learning. Основные направления:
- Production Cost Down: применять deep learning к game-production pipeline для повышения эффективности и улучшения опыта создателей.
- New Way to Create: расширять способы создания игр с помощью generative AI и других deep-learning технологий.
- Virtual Friends: создавать Virtual Friends на базе deep learning и новые пользовательские сценарии внутри и вне игр.
- Unique, Endless Gameplay: использовать deep learning для игрового контента, который даёт пользователям новый опыт при каждом прохождении.
Команда работает горизонтально и активно общается между дисциплинами, поощряя свободное обсуждение идей независимо от должности и стажа.
О команде и роли
KRAFTON MLSys & Ops строит высокопроизводительную и эффективную ML-serving платформу, чтобы исследовательские AI-модели стабильно работали в production — как в game-production окружении, так и в customer-facing сервисах.
Роль ML Serving Engineer предполагает проектирование и непосредственную реализацию архитектуры для стабильного и cost-efficient serving LLM, coding agents и других передовых deep-learning моделей на современной GPU-инфраструктуре KRAFTON. Нужно исследовать и внедрять современные техники inference acceleration и optimization в реальные production services.
Миссия
- Проектировать и эксплуатировать production-grade large-model serving architecture.
- Строить и стабилизировать LLM serving infrastructure для real-time использования непосредственно in-game.
- Обслуживать и ускорять coding-agent services, включая GLM, где критичны throughput и низкая latency.
- Формировать единый serving framework для новых моделей разных доменов из AI Research.
- Строить observability и CI/CD pipelines.
- Создавать интегрированные monitoring/logging/alerting systems для стабильной работы при large-scale serving и realtime issue detection.
- Проектировать надёжный CI/CD/GitOps для zero-downtime model updates, automatic rollback и automated testing.
- Исследовать и внедрять inference acceleration и serving optimization.
- Снижать serving cost и сохранять performance под большой нагрузкой с помощью методов вроде TurboQuant, CacheBlend, FP8/INT4 quantization.
- Развивать KV-cache optimization — GPU/CPU/disk offloading/loading и shared cache — а также Continuous Batching, PagedAttention и другие современные LLM-serving техники.
Обязательные требования
- Реальный опыт проектирования, строительства и эксплуатации AI/LLM serving systems под большим production traffic.
- Практическое использование high-performance LLM inference engines вроде vLLM и TensorRT-LLM, включая optimization и stabilization.
- Опыт значительного снижения cost и роста performance через KV-cache offloading/loading, PagedAttention, quantization и другие memory/compute optimizations.
- Глубокий анализ failures и latency problems на уровнях inference engine, framework и GPU hardware и устранение root causes.
- Опыт самостоятельного построения и развития monitoring/observability и CI/CD для serving reliability.
- Возможность зарубежных командировок.
Будет преимуществом
- Способность принимать архитектурные решения и ясно понимать trade-offs по cost, latency и reliability.
- Contribution в vLLM, LMCache или другие open-source serving ecosystems.
- Глубокое знание vLLM, TensorRT-LLM, PyTorch Dynamo, FlashInfer, NVIDIA Triton и опыт custom kernels/CUDA low-level acceleration.
Найм и условия
Процесс: application review → assignment (может зависеть от позиции) → Personality Assessment → Technical Fit Interview → 2–3 Culture Fit Interviews → оффер. Требуются резюме, cover letter, career description, transcript и обязательное portfolio. Работа — Yeoksam Centerfield West Tower. Тип занятости — permanent, но может измениться по итогам обсуждения условий. Применяется 5-месячный probation period.
Отклик принимает студия на своём сайте. LOOTWORK только показывает вакансию.