카카오 · 테크

AI Platform 추론 최적화 Engineer(경력)

#카카오 채용

이 공고, 이렇게 물어볼 겁니다

Q1
LLM 추론 성능 향상을 위한 캐시, 배칭, 양자화, 커널 최적화 등 주요 기법 적용 시 어떤 지표를 사용하여 성능 개선을 측정하시나요?
🎯 성능 개선 지표 측정 방법 확인
Q2
분산 추론 전략 설계 및 구현 시 Tensor, Pipeline, Expert, Sequence Parallelism, MoE 라우팅 등을 어떻게 선택하시나요?
🎯 분산 추론 전략 선택 기준 확인
Q3
Kubernetes 기반 LLM 서빙 인프라 구축, 운영 및 자동화 시 어떤 도구와 방법을 사용하시나요?
🎯 Kubernetes 기반 인프라 구축 방법 확인
Q4
LLM 추론 가속 기법(Speculative Decoding, Mixture-of-Experts, FlashAttention, PagedAttention, RadixAttention 등)을 실무에 적용한 경험에서 어떤 결과를 얻으셨나요?
🎯 LLM 추론 가속 기법 적용 결과 확인
Q5
대규모 GPU 클러스터(수십~수백 GPU 이상) 환경에서의 추론 워크로드 운영 시 어떤 성능 프로파일링 및 최적화 기법을 사용하시나요?
🎯 대규모 GPU 클러스터 성능 프로파일링 및 최적화 방법 확인
질문만 읽으면 컨닝이에요. 소리 내어 답해보세요 — 어디서 틀어지는지 짚어드립니다.

공고 내용

◆ 소개

AI플랫폼팀은 카카오의 모든 AI 서비스가 안정적으로 동작하도록 기반을 설계하고 운영하는 팀으로, Kakao AI Platform(이하 KAP)을 만들어 수천 장 규모의 GPU 클러스터 위에서 추론 서비스의 효율적이고 안정적인 서빙을 책임지고 있습니다.

MLOps/LLMOps의 역할을 담당하며 전통적인 ML 워크로드부터 오픈소스 LLM, kanana 모델까지 카카오 내 AI 서비스들의 배포와 운영을 효율화하는 것을 핵심 미션으로 삼고 있습니다.

참고)

🔗 IF KAKAO 2024: Kakao AI Platform 소개 [(link)](https://www.youtube.com/watch?v=F3FQr1cpdCM)

🔗 IF KAKAO 2025: GenAI를 위한 Gateway [(link)](https://if.kakao.com/2025/session?tab=day2&sessionId=55)

◆ 업무

- LLM 추론 엔진 기반의 AI 서빙 플랫폼 설계 및 최적화

- vLLM, SGLang, TensorRT-LLM 등 오픈소스 추론 엔진의 도입, 적용 및 운영

- LLM 추론 성능 향상을 위한 캐시, 배칭, 양자화, 커널 최적화 등 주요 기법 적용

- 분산 추론 전략 설계 및 구현 (Tensor / Pipeline / Expert / Sequence Parallelism, MoE 라우팅)

- 추론 워크로드의 latency, throughput, TTFT, TPOT 등 성능 지표 측정 및 개선

- Kubernetes 기반 LLM 서빙 인프라 구축, 운영 및 자동화

- 라우팅·오토스케일링·로드밸런싱·요청 스케줄링 등 서빙 시스템 기능 개발

- 코드 리뷰, 테스팅, 지속적인 통합(CI) 및 지속적인 배포(CD)를 통해 높은 품질의 서비스 제공

◆ 자격

- Python 또는 Go을 활용한 시스템/백엔드/ML 시스템 개발 경력이 5년 이상인 분

- Transformer 아키텍처 및 LLM 동작 원리(어텐션, KV cache, 디코딩 전략 등)에 대한 깊은 이해가 있는 분

- vLLM, SGLang, TensorRT-LLM, TGI 중 하나 이상을 실제 프로덕션 또는 대규모 실험 환경에서 운영해 본 경험이 있는 분

- GPU 환경에서의 성능 프로파일링 및 최적화 경험이 있는 분 (Nsight, NCU, PyTorch Profiler 등)

- K8s에 대한 이해도가 높은 분

- 클라우드 환경에서의 CI/CD 경험이 있는 분

- 새로운 환경에 도전하는 오픈 마인드를 가진 분

**◆ 우대사항**

- vLLM, SGLang, TensorRT-LLM, Hugging Face Transformers, PyTorch 등 LLM/ML 오픈소스 프로젝트에 의미 있는 컨트리뷰션 경험이 있는 분 (PR 머지, RFC 작성, 메인테이너 활동, 이슈 트리아지 등)

- CUDA / Triton 커널을 직접 작성하거나 튜닝해 본 경험이 있는 분

- LLM 추론 가속 기법(Speculative Decoding, Mixture-of-Experts, FlashAttention, PagedAttention, RadixAttention 등)을 실무에 적용해 본 경험이 있는 분

- 모델 양자화 / 압축 (AWQ, GPTQ, FP8, INT4, SmoothQuant, Pruning, Distillation 등) 실무 경험이 있는 분

- 대규모 분산 추론(Tensor / Pipeline / Expert Parallelism, Disaggregated Prefill-Decode 등)을 설계·운영해 본 경험이 있는 분

- NVIDIA Triton Inference Server, KServe, Ray Serve, vLLM Production Stack, LLM-D 등 서빙 플랫폼 구축 경험이 있는 분

- 대규모 GPU 클러스터(수십~수백 GPU 이상) 환경에서의 추론 워크로드 운영 경험이 있는 분

- 고성능 네트워킹(RDMA, RoCE, InfiniBand, NCCL 튜닝) 또는 네트워크 트러블 슈팅 경험이 있는 분

- ML 또는 AI 동작에 대한 이해도가 높은 분

- 다양한 프로그래밍 언어 사용에 대한 거부감이 없는 분 (Python / C++ / CUDA / Go / Rust 등)

- LLM 추론 성능 관련 논문을 읽고 구현/재현해 본 경험이 있는 분

원문에서 전체 공고 보기 →

이 회사 다른 포지션 · 비슷한 공고