職務概要
高性能なモデル推論サービス基盤を構築・運用する、情熱ある AI 推論エンジニアを募集しています。GPU クラスタのデプロイ、モデル最適化から、安定かつ効率的な推論サービスの外部提供まで、技術チェーン全体を担当していただきます。深い技術力に加えてビジネス感覚を備え、性能・コスト・ユーザー体験の最適なバランスを見いだせる方を求めています。
主な職責
推論インフラの構築と運用
- GPU ベースのモデル推論クラスタ(マルチ GPU・マルチノード)の設計・デプロイ・運用
- オープンソースモデルおよび自社開発の小型モデルのデプロイ、バージョン管理、ライフサイクル管理
- 高可用・スケーラブルな推論サービスアーキテクチャを構築し、安定稼働を担保(SLA ≥ 99.9%)
推論性能の最適化
- LLM およびマルチモーダルモデル(MiniMax H3 など)の推論高速化・性能チューニング
- 量子化(INT8/INT4)、オペレータ融合、グラフ最適化などでレイテンシ削減・スループット向上を実現
- GPU メモリ管理を最適化し、リソース利用率を最大化
- 特定のビジネスシナリオ向けにカスタム最適化を行い、速度・精度・コストのバランスを取る
分散デプロイとネットワーク最適化
- マルチ GPU・マルチノード環境での並列推論デプロイを実現
- ノード間通信を最適化。RDMA、InfiniBand などの高速ネットワーク技術に精通
- 分散推論における負荷分散、データ並列 / パイプライン並列などの課題を解決
コスト管理と事業化支援
- 推論サービスのリソース消費を監視・分析し、リクエスト単価を継続的に最適化
- コスト計算モデルを構築し、製品価格設定や事業判断にデータを提供
- ハードウェア構成(GPU 型番、クラウド vs 自社構築)のコストパフォーマンスを評価
技術サービスと協業
- 社内プロダクトと外部顧客向けに、安定した推論 API サービスを提供
- アルゴリズムチームと連携し、学習済みモデルを効率よく本番品質の推論サービスへ変換
- 技術ドキュメントを整備し、運用監視体制と障害対応フローを構築
応募要件
- コンピュータサイエンス、AI、電子情報などの関連分野で学士以上
- AI インフラまたはモデルデプロイ関連の経験 3 年以上
- 主要な推論フレームワークのいずれかに精通:TensorRT、vLLM、TGI、Triton Inference Server、DeepSpeed-Inference など
- PyTorch / TensorFlow のモデルエクスポートとデプロイフローに習熟
- GPU アーキテクチャへの深い理解。CUDA プログラミングやカーネル最適化の経験があれば尚可
- Docker、Kubernetes などのコンテナデプロイ技術に精通
- Linux の運用とネットワークデバッグができること
歓迎要件
- 大規模言語モデル(LLM)またはマルチモーダルモデル(VLM)の本番デプロイ経験
- モデル学習フローに精通し、学習から推論までの技術的課題を理解している
- 分散学習フレームワークの知識:DeepSpeed、Megatron-LM、FSDP など
- 量子化、プルーニング、蒸留などモデル圧縮技術の実践経験
- クラウド GPU インスタンスの選定と最適化に精通(AWS、Azure、Alibaba Cloud など)
- 推論サービス基盤をゼロから構築した経験
重視する資質
- ビジネス感覚:コストに敏感で、事業の観点から技術方針を考えられる
- 問題解決力:複雑なシステム課題の特定と解決が得意
- 学習意欲:AI 技術への強い好奇心を持ち、最前線を主体的に追う
- コミュニケーション:技術提案を明確に説明でき、チームを越えた協業に強い
- 成果志向:技術的完璧さより最終的なビジネス価値を重視
応募方法
勤務地は香港・深圳・シンガポールのいずれか。ログインすると応募先メールアドレスが表示され、履歴書を採用担当者へ直接送れます。
ログインすると応募先メールアドレスが表示されます。