mempool.asia
Amber Group · AI Inference Engineer

AI 推論エンジニア

高性能な推論サービスを構築し、性能・コスト・ユーザー体験の最適なバランスを見つける。

香港 · 深圳 · シンガポール関連経験 3 年以上
効率的な推論サービスを一緒に
香港深圳シンガポール正社員
ログインすると応募先メールアドレスが表示されます。

職務概要

高性能なモデル推論サービス基盤を構築・運用する、情熱ある AI 推論エンジニアを募集しています。GPU クラスタのデプロイ、モデル最適化から、安定かつ効率的な推論サービスの外部提供まで、技術チェーン全体を担当していただきます。深い技術力に加えてビジネス感覚を備え、性能・コスト・ユーザー体験の最適なバランスを見いだせる方を求めています。

主な職責

推論インフラの構築と運用

  • GPU ベースのモデル推論クラスタ(マルチ GPU・マルチノード)の設計・デプロイ・運用
  • オープンソースモデルおよび自社開発の小型モデルのデプロイ、バージョン管理、ライフサイクル管理
  • 高可用・スケーラブルな推論サービスアーキテクチャを構築し、安定稼働を担保(SLA ≥ 99.9%)

推論性能の最適化

  • LLM およびマルチモーダルモデル(MiniMax H3 など)の推論高速化・性能チューニング
  • 量子化(INT8/INT4)、オペレータ融合、グラフ最適化などでレイテンシ削減・スループット向上を実現
  • GPU メモリ管理を最適化し、リソース利用率を最大化
  • 特定のビジネスシナリオ向けにカスタム最適化を行い、速度・精度・コストのバランスを取る

分散デプロイとネットワーク最適化

  • マルチ GPU・マルチノード環境での並列推論デプロイを実現
  • ノード間通信を最適化。RDMA、InfiniBand などの高速ネットワーク技術に精通
  • 分散推論における負荷分散、データ並列 / パイプライン並列などの課題を解決

コスト管理と事業化支援

  • 推論サービスのリソース消費を監視・分析し、リクエスト単価を継続的に最適化
  • コスト計算モデルを構築し、製品価格設定や事業判断にデータを提供
  • ハードウェア構成(GPU 型番、クラウド vs 自社構築)のコストパフォーマンスを評価

技術サービスと協業

  • 社内プロダクトと外部顧客向けに、安定した推論 API サービスを提供
  • アルゴリズムチームと連携し、学習済みモデルを効率よく本番品質の推論サービスへ変換
  • 技術ドキュメントを整備し、運用監視体制と障害対応フローを構築

応募要件

  • コンピュータサイエンス、AI、電子情報などの関連分野で学士以上
  • AI インフラまたはモデルデプロイ関連の経験 3 年以上
  • 主要な推論フレームワークのいずれかに精通:TensorRT、vLLM、TGI、Triton Inference Server、DeepSpeed-Inference など
  • PyTorch / TensorFlow のモデルエクスポートとデプロイフローに習熟
  • GPU アーキテクチャへの深い理解。CUDA プログラミングやカーネル最適化の経験があれば尚可
  • Docker、Kubernetes などのコンテナデプロイ技術に精通
  • Linux の運用とネットワークデバッグができること

歓迎要件

  • 大規模言語モデル(LLM)またはマルチモーダルモデル(VLM)の本番デプロイ経験
  • モデル学習フローに精通し、学習から推論までの技術的課題を理解している
  • 分散学習フレームワークの知識:DeepSpeed、Megatron-LM、FSDP など
  • 量子化、プルーニング、蒸留などモデル圧縮技術の実践経験
  • クラウド GPU インスタンスの選定と最適化に精通(AWS、Azure、Alibaba Cloud など)
  • 推論サービス基盤をゼロから構築した経験

重視する資質

  • ビジネス感覚:コストに敏感で、事業の観点から技術方針を考えられる
  • 問題解決力:複雑なシステム課題の特定と解決が得意
  • 学習意欲:AI 技術への強い好奇心を持ち、最前線を主体的に追う
  • コミュニケーション:技術提案を明確に説明でき、チームを越えた協業に強い
  • 成果志向:技術的完璧さより最終的なビジネス価値を重視

応募方法

勤務地は香港・深圳・シンガポールのいずれか。ログインすると応募先メールアドレスが表示され、履歴書を採用担当者へ直接送れます。

ログインすると応募先メールアドレスが表示されます。

Amber Group香港 · 深圳 · シンガポール