Foundation Model Evaluation Team всесторонне оценивает собственные foundation models KRAFTON и global frontier LLMs и использует данные оценки, чтобы определять направление model development. Поскольку стандартные benchmarks измеряют разные свойства и один score редко отражает реальные возможности модели, команда глубоко анализирует, где именно модель сильна или слаба, и связывает результаты с конкретными улучшениями.
Команда одновременно использует стандартные benchmarks, за которыми следит global frontier, и собственные evaluation sets, отражающие реальные use cases, чтобы отслеживать тенденции моделей. Результаты передаются model/data teams и напрямую влияют на technical roadmap и data strategy.
Миссия
Определять capabilities и targets, на которых должна сосредоточиться собственная модель, задавая направление model development.
Проектировать новые benchmarks, которые измеряют реальные capabilities без искажения от data contamination.
Диагностировать frontier и internal models, быстро оценивать новые модели и поддерживать technical decision-making.
Тесно работать с data/model teams, выявлять слабости данных и возможности улучшения model design.
Разрабатывать evaluation pipelines/platforms для стабильного запуска large-scale evaluation и централизовать результаты и insights.
Публиковать результаты в Tech Reports или на top-tier venues: NeurIPS, ICLR, ICML, ACL, EMNLP и др.
Обязательные требования
Магистратура/PhD в deep-learning related field либо эквивалентный research experience.
Опыт публикации работ по AI model evaluation/analysis или ML/NLP на top-tier AI/ML conferences — NeurIPS, ICLR, ICML, ACL, EMNLP и др.
Способность внимательно работать с данными и извлекать insights на детальном уровне.
Сильная письменная коммуникация по complex experiments и result analysis.
Быстрая адаптация к новым domains.
Хорошая рабочая коммуникация.
Возможность зарубежных командировок.
Будет преимуществом
Доклады/награды на top-tier AI/ML conferences.
Hands-on сбор, генерация и очистка данных для model evaluation.
Проектирование собственных evaluation benchmarks или toolkits.
Проектирование/разработка agentic flows.
Построение и эксплуатация large-scale evaluation pipelines и distributed execution infrastructure.
Широкий опыт с Foundation Models/LLMs разных размеров.
Умение эффективно распространять и обсуждать lessons learned.
Найм и условия
Процесс: application review → phone interview → take-home/Pre-Test → Technical Fit Interview → offer. Требуются resume, cover letter, career description, transcript; portfolio optional. Место работы — Seongsu. Стажировка на 3 месяца.