이 공고, 이렇게 물어볼 겁니다
공고 내용
◆ 소개
AI플랫폼팀은 카카오의 모든 AI 서비스가 안정적으로 동작하도록 기반을 설계하고 운영하는 팀으로, Kakao AI Platform(이하 KAP)을 만들어 수천 장 규모의 GPU 클러스터 위에서 추론 서비스의 효율적이고 안정적인 서빙을 책임지고 있습니다.
MLOps/LLMOps의 역할을 담당하며 전통적인 ML 워크로드부터 오픈소스 LLM, kanana 모델까지 카카오 내 AI 서비스들의 배포와 운영을 효율화하는 것을 핵심 미션으로 삼고 있습니다.
참고)
🔗 IF KAKAO 2024: Kakao AI Platform 소개 [(link)](https://www.youtube.com/watch?v=F3FQr1cpdCM)
🔗 IF KAKAO 2025: GenAI를 위한 Gateway [(link)](https://if.kakao.com/2025/session?tab=day2&sessionId=55)
◆ 업무
- LLM 추론 엔진 기반의 AI 서빙 플랫폼 설계 및 최적화
- vLLM, SGLang, TensorRT-LLM 등 오픈소스 추론 엔진의 도입, 적용 및 운영
- LLM 추론 성능 향상을 위한 캐시, 배칭, 양자화, 커널 최적화 등 주요 기법 적용
- 분산 추론 전략 설계 및 구현 (Tensor / Pipeline / Expert / Sequence Parallelism, MoE 라우팅)
- 추론 워크로드의 latency, throughput, TTFT, TPOT 등 성능 지표 측정 및 개선
- Kubernetes 기반 LLM 서빙 인프라 구축, 운영 및 자동화
- 라우팅·오토스케일링·로드밸런싱·요청 스케줄링 등 서빙 시스템 기능 개발
- 코드 리뷰, 테스팅, 지속적인 통합(CI) 및 지속적인 배포(CD)를 통해 높은 품질의 서비스 제공
◆ 자격
- Python 또는 Go을 활용한 시스템/백엔드/ML 시스템 개발 경력이 5년 이상인 분
- Transformer 아키텍처 및 LLM 동작 원리(어텐션, KV cache, 디코딩 전략 등)에 대한 깊은 이해가 있는 분
- vLLM, SGLang, TensorRT-LLM, TGI 중 하나 이상을 실제 프로덕션 또는 대규모 실험 환경에서 운영해 본 경험이 있는 분
- GPU 환경에서의 성능 프로파일링 및 최적화 경험이 있는 분 (Nsight, NCU, PyTorch Profiler 등)
- K8s에 대한 이해도가 높은 분
- 클라우드 환경에서의 CI/CD 경험이 있는 분
- 새로운 환경에 도전하는 오픈 마인드를 가진 분
**◆ 우대사항**
- vLLM, SGLang, TensorRT-LLM, Hugging Face Transformers, PyTorch 등 LLM/ML 오픈소스 프로젝트에 의미 있는 컨트리뷰션 경험이 있는 분 (PR 머지, RFC 작성, 메인테이너 활동, 이슈 트리아지 등)
- CUDA / Triton 커널을 직접 작성하거나 튜닝해 본 경험이 있는 분
- LLM 추론 가속 기법(Speculative Decoding, Mixture-of-Experts, FlashAttention, PagedAttention, RadixAttention 등)을 실무에 적용해 본 경험이 있는 분
- 모델 양자화 / 압축 (AWQ, GPTQ, FP8, INT4, SmoothQuant, Pruning, Distillation 등) 실무 경험이 있는 분
- 대규모 분산 추론(Tensor / Pipeline / Expert Parallelism, Disaggregated Prefill-Decode 등)을 설계·운영해 본 경험이 있는 분
- NVIDIA Triton Inference Server, KServe, Ray Serve, vLLM Production Stack, LLM-D 등 서빙 플랫폼 구축 경험이 있는 분
- 대규모 GPU 클러스터(수십~수백 GPU 이상) 환경에서의 추론 워크로드 운영 경험이 있는 분
- 고성능 네트워킹(RDMA, RoCE, InfiniBand, NCCL 튜닝) 또는 네트워크 트러블 슈팅 경험이 있는 분
- ML 또는 AI 동작에 대한 이해도가 높은 분
- 다양한 프로그래밍 언어 사용에 대한 거부감이 없는 분 (Python / C++ / CUDA / Go / Rust 등)
- LLM 추론 성능 관련 논문을 읽고 구현/재현해 본 경험이 있는 분