이 공고, 이렇게 물어볼 겁니다
Q1
GPU 인프라를 새로 도입하거나 업그레이드할 때, '이 GPU를 이 아키텍처로 가자'고 결정한 구체 사례가 있을까요? 어떤 선택지가 있었고 PoC를 어떻게 검증했으며 도입 후 성공을 무엇으로 확인했는지 말씀해 주세요.
🎯 기술 판단력·PoC 설계·성과 정량화 여부를 실제 의사결정 사례로 검증
Q2
GPU 클러스터를 운영하다 성능 저하나 장애를 경험했을 때, '증상이 이랬는데 결국 ○○(커널·드라이버·네트워크·메모리)가 원인이었다' 는 구체 사례를 말씀해 주세요. 어떤 도구로 진단했고 근본 원인까지 파고드는 데 얼마나 걸렸어요?
🎯 OS/커널/하드웨어 레이어의 기술 깊이·체계적 진단 능력·근본 원인 분석
Q3
GPU 자원 사용률이 높아지는 상황에서 '언제' '몇 개' '어떤 구성으로' 증설할지 판단했던 사례를 말씀해 주세요. 만약 전력·냉각·자본금이 다 제약이었다면 어떤 지표를 우선으로 봤고 무엇을 먼저 선택하셨나요?
🎯 용량 계획의 정량화·예측 모델·제약 속 우선순위 의사결정 능력
Q4
'반복되는 운영을 코드로 자동화한다'고 하셨는데, 구체적으로 어떤 수작업을 없앴어요? 그 결과 시간·비용·휴먼에러가 정확히 얼마나 줄었는지 숫자를 하나만 말씀해 주세요.
🎯 자동화 구현의 구체성·임팩트 정량화·엔지니어로서 생산성 마인드 검증
Q5
AI팀이나 다른 조직과 GPU 할당·우선순위 때문에 의견이 갈렸던 경험을 구체적으로 말씀해 주세요. 그 팀은 무엇을 원했고 당신은 다른 의견을 제시했다면 어떤 근거(데이터·벤치·계산)로 설득했어요? 결국 어떻게 결정됐고 그게 맞았나요?
🎯 기술 논리 기반 협업·이해관계 조정·데이터로 설득하는 능력(정치 회피)
질문만 읽으면 컨닝이에요. 소리 내어 답해보세요 — 어디서 틀어지는지 짚어드립니다.
공고 내용
함께하게 될 팀에 대해 알려드려요
- 토스의 System Platform 팀은 Network Engineer, InfraOps Engineer와 함께 Infra Engineering Tribe에 속해 있어요.
- System Platform 팀은 IDC 베어메탈부터 퍼블릭 클라우드까지, 서비스가 올라가는 시스템 기반을 직접 설계하고 운영해요.
- 이 포지션은 AI/ML 워크로드가 안정적으로 동작할 수 있는 GPU 인프라를 담당해요.
- 어떤 GPU를 어떤 구조로 도입하고 어떻게 확장할지 판단하며 차세대 AI 인프라 로드맵을 함께 만들어가요.
합류하면 함께 할 업무예요
- GPU 컴퓨팅 클러스터 인프라를 설계하고, 베어메탈부터 구축해 운영해요.
- 최신 GPU 라인업과 아키텍처 변화를 추적하고, PoC와 벤치마크로 도입을 검증하며 인프라 로드맵을 세워요.
- GPU 서버의 표준 OS와 소프트웨어 스택을 구성하고, 대규모 노드를 재현 가능하게 프로비저닝해요.
- 고성능 네트워크와 스토리지를 설계해 클러스터 성능을 최적화해요.
- GPU 자원을 모니터링하고, 장애를 진단하고 근본 원인을 찾아 대응하며 운영을 자동화해요.
- 사용률과 용량 지표를 근거로 증설 시점을 판단해 전력, 냉각, 랙 등 인프라 환경을 고려하여 안정적으로 증설해요.
이런 분과 함께하고 싶어요.
- 시스템 엔지니어로 3년 이상, 대규모 Linux 서버 인프라를 운영해 보신 분이면 좋아요.
- OS, 커널, 드라이버 중 한 영역 이상을 깊이 다뤄 문제를 해결해 본 분이면 좋아요.
- GPU 서버를 활용한 HPC 또는 AI 클러스터를 구축하고 운영해 본 경험이 있으신 분이면 좋아요.
- 반복되는 운영을 코드로 자동화하고, 표준과 문서로 남겨 본 분이면 좋아요.
- 여러 팀과 기술적인 논리에 기반해 협업할 수 있는 분이면 좋아요.
이런 경험이 있다면 더 좋아요
- CUDA, NCCL, NVLink, RDMA와 같은 GPU 컴퓨팅 기술에 대한 이해가 있으면 더 좋아요.
- InfiniBand 또는 RoCE 기반 고속 네트워크를 설계하고 운영해 본 경험이 있으면 더 좋아요.
- 펌웨어, BIOS, BMC 등 하드웨어 레벨을 직접 다뤄본 경험이 있으면 더 좋아요.
- DCGM, Prometheus, Grafana 등으로 모니터링 체계를 구축해 본 경험이 있으면 더 좋아요.
- AI/ML 조직과 협업하거나 MLOps 파이프라인을 이해하고 있으면 더 좋아요.
- IDC 전력, 냉각, 랙 등 물리 인프라를 고려해 대규모 컴퓨팅 환경을 설계해 본 경험이 있으면 더 좋아요.
이 회사 다른 포지션 · 비슷한 공고
토스커뮤니티 Android · iOS Developer 대규모 채용 (~10/11)iOS · Swift · Android · KotliniOS·안드로이드토스플레이스토스커뮤니티 Server Developer 대규모 채용 (3년 이하) (~10/15)개발 · Server · Kotlin · Spring백엔드토스플레이스Sales Development Specialist 1차 대규모채용 (~10/31)집중채용 · Sales · 페이먼츠 · 영업 · 방문 영업 · 전화 영업PM·기획 · 영업·사업토스페이먼츠Direct Sales Associate 대규모 채용 (~10/12)집중채용 · 신입채용 · 영업 · Direct Sales영업·사업토스플레이스Account Management Specialistsales · 영업 · 결제 · 기가맹관리 · 세일즈영업·사업토스페이먼츠Account Manager오프라인 · 토스페이 · 페이스페이 · 영업 · 제휴영업·사업