About The Team & Mission
LLM Engineer (LLM Evaluation)는 대규모 언어 모델(LLM)의 성능을 신뢰성 있게 평가하고, 평가 결과를 기반으로 모델 품질을 지속적으로 개선할 수 있는 평가 체계와 플랫폼을 구축합니다.
빠르게 변화하는 LLM 환경 속에서 benchmark dataset, evaluation protocol, automation pipeline을 설계하여 모델의 품질과 안정성을 지속적으로 향상시키고, 실서비스 수준의 검증 체계를 운영하는 데 기여합니다.
또한 Kubernetes 기반 환경에서 Argo Workflows 및 MLflow를 활용하여 모델 평가–실험 관리–배포 검증까지 이어지는 end-to-end evaluation workflow를 구축하고, 반복 가능하고 재현성 있는 평가 환경을 고도화합니다.
Responsibilities
- LLM Evaluation & Benchmark 설계
- LLM 성능 평가를 위한 벤치마크 데이터셋 구축 및 평가 지표(Human/LLM-based) 설계
- 공정한 모델 비교를 위한 평가 프로토콜 수립 및 재현성(Reproducibility) 확보
- Evaluation Automation 및 Workflow 연동
- Argo Workflows, MLflow 기반의 평가 자동화 환경 구축 및 ML 파이프라인 통합
- 모델 배포 시 성능 저하(Regression) 자동 감지 및 알림 체계 설계
- Model Quality Validation 및 운영 고도화
- 반복 가능한 평가 워크플로우를 통한 대규모 모델 품질 및 안정성 검증
- 평가 결과를 바탕으로 한 지속적인 모델 품질 개선 프로세스 운영
Qualifications
- LLM 학습 또는 평가 관련 분야 3년 이상 경력
- Deep Learning 또는 NLP 관련 연구 및 개발 경험
- LLM evaluation framework 사용 경험 (lm-eval, HELM, OpenAI Evals 등)
- Python 기반 서비스 개발 경험 (async/비동기 처리 포함)
- 실험 관리 및 reproducibility에 대한 이해
- 모델 평가 및 validation workflow 설계 경험
- 동료와의 원활한 협업 능력
Preferred Qualifications
- Kubernetes 및 컨테이너 기반 환경 개발 경험
- 대규모 데이터 처리 또는 pipeline 설계 경험
- GPU 기반 분산 inference 또는 대규모 모델 평가 경험
- Datadog, Prometheus 등을 활용한 모니터링 구축 경험
- MLflow, Argo Workflows 기반 ML workflow 운영 경험
- GPU 클러스터 기반 evaluation pipeline 설계 및 운영 경험
- LLM 품질 평가 자동화 및 운영 경험