mempool.asia
Amber Group · AI Inference Engineer

AI 模型推理工程师

构建高性能推理服务,在性能、成本与用户体验之间找到最佳平衡。

香港 · 深圳 · 新加坡3 年以上相关经验
一起构建高效推理服务
香港深圳新加坡全职
登录后查看投递邮箱。

职位概述

我们正在寻找一位充满热情的 AI 模型推理工程师,负责构建和维护高性能的模型推理服务基础设施。您将负责从 GPU 集群部署、模型优化到对外提供稳定高效的推理服务的完整技术链路。理想的候选人不仅具备深厚的技术功底,还具备商业化思维,能够在性能、成本和用户体验之间找到最佳平衡点。

核心职责

推理基础设施搭建与维护

  • 设计、部署和维护基于 GPU 的模型推理集群(多卡、多节点)
  • 负责开源模型及自研小模型的部署、版本管理和生命周期维护
  • 构建高可用、可扩展的推理服务架构,确保服务稳定性(SLA ≥ 99.9%)

模型推理性能优化

  • 对 LLM 及多模态模型(如 MiniMax H3 等)进行推理加速和性能调优
  • 实施量化(INT8/INT4)、算子融合、图优化等技术手段,降低延迟、提升吞吐
  • 优化显存管理策略,最大化 GPU 资源利用率
  • 针对特定业务场景进行定制化优化,平衡推理速度、精度和成本

分布式部署与网络优化

  • 实现模型在多 GPU、多节点环境下的并行推理部署
  • 优化节点间通信效率,熟悉 RDMA、InfiniBand 等高速网络技术
  • 解决分布式推理中的负载均衡、数据并行 / 流水线并行等问题

成本控制与商业化支持

  • 监控和分析推理服务的资源消耗,持续优化单位请求成本
  • 建立成本核算模型,为产品定价和商业决策提供数据支持
  • 评估不同硬件方案(GPU 型号、云服务 vs 自建)的性价比

技术服务与协作

  • 对外提供稳定可靠的推理 API 服务,支持内部产品和外部客户
  • 与算法团队协作,将训练好的模型高效转化为生产级推理服务
  • 编写技术文档,建立运维监控体系和故障排查流程

任职要求

  • 计算机、人工智能、电子信息等相关专业本科及以上学历
  • 3 年以上 AI 基础设施或模型部署相关经验
  • 精通至少一种主流推理框架:TensorRT、vLLM、TGI、Triton Inference Server、DeepSpeed-Inference 等
  • 熟练掌握 PyTorch / TensorFlow 模型导出和部署流程
  • 深入理解 GPU 架构,有 CUDA 编程或 Kernel 优化经验者优先
  • 熟悉 Docker、Kubernetes 等容器化部署技术
  • 具备 Linux 系统运维和网络调试能力

加分项

  • 有大语言模型(LLM)或多模态模型(VLM)的生产环境部署经验
  • 熟悉模型训练流程,能够理解训练与推理全链路的技术痛点
  • 了解分布式训练框架:DeepSpeed、Megatron-LM、FSDP 等
  • 有模型量化、剪枝、蒸馏等模型压缩技术实践经验
  • 熟悉云服务 GPU 实例选型和优化(AWS、Azure、阿里云等)
  • 有从零搭建推理服务平台的经验

我们看重

  • 商业化思维:对成本敏感,能够从商业角度思考技术方案
  • 问题解决能力:善于定位和解决复杂的系统性问题
  • 学习热情:对 AI 技术保持强烈好奇心,主动跟进前沿技术
  • 沟通协作:能够清晰表达技术方案,跨团队协作能力强
  • 结果导向:关注最终业务价值,而非单纯追求技术完美

投递简历

香港、深圳、新加坡三地均可。登录后即可查看投递邮箱,将简历直接发送给招聘负责人。

登录后查看投递邮箱。

← 返回职位列表分享海报 →mempool.asia / pool / roles
Amber Group香港 · 深圳 · 新加坡