职位概述
我们正在寻找一位充满热情的 AI 模型推理工程师,负责构建和维护高性能的模型推理服务基础设施。您将负责从 GPU 集群部署、模型优化到对外提供稳定高效的推理服务的完整技术链路。理想的候选人不仅具备深厚的技术功底,还具备商业化思维,能够在性能、成本和用户体验之间找到最佳平衡点。
核心职责
推理基础设施搭建与维护
- 设计、部署和维护基于 GPU 的模型推理集群(多卡、多节点)
- 负责开源模型及自研小模型的部署、版本管理和生命周期维护
- 构建高可用、可扩展的推理服务架构,确保服务稳定性(SLA ≥ 99.9%)
模型推理性能优化
- 对 LLM 及多模态模型(如 MiniMax H3 等)进行推理加速和性能调优
- 实施量化(INT8/INT4)、算子融合、图优化等技术手段,降低延迟、提升吞吐
- 优化显存管理策略,最大化 GPU 资源利用率
- 针对特定业务场景进行定制化优化,平衡推理速度、精度和成本
分布式部署与网络优化
- 实现模型在多 GPU、多节点环境下的并行推理部署
- 优化节点间通信效率,熟悉 RDMA、InfiniBand 等高速网络技术
- 解决分布式推理中的负载均衡、数据并行 / 流水线并行等问题
成本控制与商业化支持
- 监控和分析推理服务的资源消耗,持续优化单位请求成本
- 建立成本核算模型,为产品定价和商业决策提供数据支持
- 评估不同硬件方案(GPU 型号、云服务 vs 自建)的性价比
技术服务与协作
- 对外提供稳定可靠的推理 API 服务,支持内部产品和外部客户
- 与算法团队协作,将训练好的模型高效转化为生产级推理服务
- 编写技术文档,建立运维监控体系和故障排查流程
任职要求
- 计算机、人工智能、电子信息等相关专业本科及以上学历
- 3 年以上 AI 基础设施或模型部署相关经验
- 精通至少一种主流推理框架:TensorRT、vLLM、TGI、Triton Inference Server、DeepSpeed-Inference 等
- 熟练掌握 PyTorch / TensorFlow 模型导出和部署流程
- 深入理解 GPU 架构,有 CUDA 编程或 Kernel 优化经验者优先
- 熟悉 Docker、Kubernetes 等容器化部署技术
- 具备 Linux 系统运维和网络调试能力
加分项
- 有大语言模型(LLM)或多模态模型(VLM)的生产环境部署经验
- 熟悉模型训练流程,能够理解训练与推理全链路的技术痛点
- 了解分布式训练框架:DeepSpeed、Megatron-LM、FSDP 等
- 有模型量化、剪枝、蒸馏等模型压缩技术实践经验
- 熟悉云服务 GPU 实例选型和优化(AWS、Azure、阿里云等)
- 有从零搭建推理服务平台的经验
我们看重
- 商业化思维:对成本敏感,能够从商业角度思考技术方案
- 问题解决能力:善于定位和解决复杂的系统性问题
- 学习热情:对 AI 技术保持强烈好奇心,主动跟进前沿技术
- 沟通协作:能够清晰表达技术方案,跨团队协作能力强
- 结果导向:关注最终业务价值,而非单纯追求技术完美
投递简历
香港、深圳、新加坡三地均可。登录后即可查看投递邮箱,将简历直接发送给招聘负责人。
登录后查看投递邮箱。