직무 개요
고성능 모델 추론 서비스 인프라를 구축하고 운영할 열정적인 AI 추론 엔지니어를 찾고 있습니다. GPU 클러스터 배포와 모델 최적화부터 안정적이고 효율적인 추론 서비스의 외부 제공까지 전체 기술 체인을 담당하게 됩니다. 깊은 기술력과 함께 비즈니스 감각을 갖추고, 성능·비용·사용자 경험 사이의 최적 균형점을 찾을 수 있는 분을 기대합니다.
주요 업무
추론 인프라 구축 및 운영
- GPU 기반 모델 추론 클러스터(멀티 GPU·멀티 노드) 설계, 배포 및 운영
- 오픈소스 모델 및 자체 개발 소형 모델의 배포, 버전 관리, 라이프사이클 관리
- 고가용성·확장 가능한 추론 서비스 아키텍처를 구축하고 안정성 보장(SLA ≥ 99.9%)
모델 추론 성능 최적화
- LLM 및 멀티모달 모델(예: MiniMax H3)의 추론 가속 및 성능 튜닝
- 양자화(INT8/INT4), 연산자 융합, 그래프 최적화 등으로 지연 시간 감소 및 처리량 향상
- GPU 메모리 관리 전략을 최적화하여 자원 활용률 극대화
- 특정 비즈니스 시나리오에 맞춘 최적화로 속도·정확도·비용의 균형 확보
분산 배포 및 네트워크 최적화
- 멀티 GPU·멀티 노드 환경에서 모델 병렬 추론 배포 구현
- 노드 간 통신 효율 최적화. RDMA, InfiniBand 등 고속 네트워크 기술에 익숙
- 분산 추론의 로드 밸런싱, 데이터 병렬 / 파이프라인 병렬 문제 해결
비용 관리 및 사업화 지원
- 추론 서비스의 자원 소비를 모니터링·분석하고 요청당 비용을 지속 최적화
- 비용 산정 모델을 구축하여 제품 가격 책정과 비즈니스 의사결정에 데이터 제공
- 하드웨어 옵션(GPU 모델, 클라우드 vs 자체 구축)의 가성비 평가
기술 서비스 및 협업
- 내부 제품과 외부 고객을 위한 안정적인 추론 API 서비스 제공
- 알고리즘 팀과 협력하여 학습된 모델을 프로덕션급 추론 서비스로 효율적으로 전환
- 기술 문서 작성, 운영 모니터링 체계와 장애 대응 프로세스 구축
자격 요건
- 컴퓨터공학, 인공지능, 전자정보 등 관련 전공 학사 이상
- AI 인프라 또는 모델 배포 관련 경력 3년 이상
- 주요 추론 프레임워크 중 하나 이상에 능숙: TensorRT, vLLM, TGI, Triton Inference Server, DeepSpeed-Inference 등
- PyTorch / TensorFlow 모델 내보내기 및 배포 프로세스에 능숙
- GPU 아키텍처에 대한 깊은 이해. CUDA 프로그래밍 또는 커널 최적화 경험자 우대
- Docker, Kubernetes 등 컨테이너 배포 기술에 익숙
- Linux 시스템 운영 및 네트워크 디버깅 능력
우대 사항
- 대규모 언어 모델(LLM) 또는 멀티모달 모델(VLM)의 프로덕션 배포 경험
- 모델 학습 프로세스에 익숙하며 학습-추론 전 과정의 기술적 문제를 이해
- 분산 학습 프레임워크 이해: DeepSpeed, Megatron-LM, FSDP 등
- 양자화, 프루닝, 증류 등 모델 압축 기술 실무 경험
- 클라우드 GPU 인스턴스 선정 및 최적화에 익숙(AWS, Azure, Alibaba Cloud 등)
- 추론 서비스 플랫폼을 처음부터 구축한 경험
중요하게 보는 것
- 비즈니스 감각: 비용에 민감하며 사업 관점에서 기술 방안을 고민
- 문제 해결력: 복잡한 시스템 문제를 찾아내고 해결하는 데 능숙
- 학습 열정: AI 기술에 대한 강한 호기심을 갖고 최신 기술을 주도적으로 추적
- 소통과 협업: 기술 방안을 명확히 설명하고 팀 간 협업에 강함
- 결과 지향: 기술적 완벽함보다 최종 비즈니스 가치에 집중
지원 방법
근무지는 홍콩·선전·싱가포르 중 택일. 로그인하면 지원 이메일이 표시되며 이력서를 채용 담당자에게 바로 보낼 수 있습니다.
로그인하면 지원 이메일이 표시됩니다.