mempool.asia
Amber Group · 招聘
Job Description · 职位描述

Model Inference
Engineer.

AI 模型推理工程师
Amber Group·香港 · 深圳 · 新加坡
我们正在寻找一位充满热情的AI模型推理工程师,负责构建和维护高性能的模型推理服务基础设施。您将负责从GPU集群部署、模型优化到对外提供稳定高效的推理服务的完整技术链路。理想的候选人不仅具备深厚的技术功底,还具备商业化思维,能够在性能、成本和用户体验之间找到最佳平衡点。
经验要求
3 年+
AI 基础设施 / 模型部署
学历背景
本科及以上
计算机 · AI · 电子信息
工作地点
香港 / 深圳
新加坡 均可
01

核心职责

1推理基础设施搭建与维护
  • 设计、部署和维护基于GPU的模型推理集群(多卡、多节点)
  • 负责开源模型及自研小模型的部署、版本管理和生命周期维护
  • 构建高可用、可扩展的推理服务架构,确保服务稳定性(SLA ≥ 99.9%)
2模型推理性能优化
  • 对LLM及多模态模型(如MiniMax H3等)进行推理加速和性能调优
  • 实施量化(INT8/INT4)、算子融合、图优化等技术手段降低延迟和提升吞吐
  • 优化显存管理策略,最大化GPU资源利用率
  • 针对特定业务场景进行定制化优化,平衡推理速度、精度和成本
3分布式部署与网络优化
  • 实现模型在多GPU、多节点环境下的并行推理部署
  • 优化节点间通信效率,熟悉RDMA、InfiniBand等高速网络技术
  • 解决分布式推理中的负载均衡、数据并行/流水线并行等问题
4成本控制与商业化支持
  • 监控和分析推理服务的资源消耗,持续优化单位请求成本
  • 建立成本核算模型,为产品定价和商业决策提供数据支持
  • 评估不同硬件方案(GPU型号、云服务vs自建)的性价比
5技术服务与协作
  • 对外提供稳定可靠的推理API服务,支持内部产品和外部客户
  • 与算法团队协作,将训练好的模型高效转化为生产级推理服务
  • 编写技术文档,建立运维监控体系和故障排查流程
02

任职要求 · 必备技能

  • 学历背景:计算机、人工智能、电子信息等相关专业本科及以上学历
  • 工作经验:3年以上AI基础设施或模型部署相关经验
  • 核心技术能力:
    • 精通至少一种主流推理框架(TensorRT、vLLM、TGI、Triton Inference Server、DeepSpeed-Inference等)
    • 熟练掌握PyTorch/TensorFlow模型导出和部署流程
    • 深入理解GPU架构,有CUDA编程或Kernel优化经验者优先
    • 熟悉Docker、Kubernetes等容器化部署技术
    • 具备Linux系统运维和网络调试能力
03

加分项

  • 有大语言模型(LLM)或多模态模型(VLM)的生产环境部署经验
  • 熟悉模型训练流程,能够理解训练-推理全链路的技术痛点
  • 了解分布式训练框架(DeepSpeed、Megatron-LM、FSDP等)
  • 有模型量化、剪枝、蒸馏等模型压缩技术实践经验
  • 熟悉云服务GPU实例选型和优化(AWS、Azure、阿里云等)
  • 有从零搭建推理服务平台的经验
04

软性素质

商业化思维

对成本敏感,能够从商业角度思考技术方案

问题解决能力

善于定位和解决复杂的系统性问题

学习热情

对AI技术保持强烈好奇心,主动跟进前沿技术

沟通协作

能够清晰表达技术方案,跨团队协作能力强

结果导向

关注最终业务价值,而非单纯追求技术完美

投递方式 · Apply
mempool.asia
关注 X @MempoolAsia
Amber Group
发布于 mempool.asia · Jobs
职位详情 · 投递
公众号 KeyMapDAO
导出视图2x1080 宽长图 · 可发朋友圈 / 群 / 公众号 · 打开纯海报画布,截图即可;2x 可导出 2160 宽高清图