工作地点:
四川省-成都市
工作职责:
1. AI算法工程化落地与FDE前向交付:负责AI算法的工程化适配与底层性能优化,结合推理引擎、分布式训练等AI Infra技术栈,保障模型线上推理的极致性能与高可用投产;同时深入客户现场或业务一线,完成需求拆解、方案设计、PoC验证、上线护航与验收交付,快速诊断现场推理性能、服务稳定性等问题并推动交付闭环,沉淀可复用的部署文档、调优指南与行业交付方案。
2. 推理引擎加速与优化:掌握vLLM、TensorRT-LLM、SGLang等主流推理引擎,开展算子加速、显存管理(KV Cache优化、量化)等工作,降低推理延迟与单位Token的计算成本,并结合客户实际硬件与流量特征完成参数调优与成本性能平衡。
3. 分布式训练基础设施:搭建并优化分布式训练集群,熟悉PyTorch DDP、DeepSpeed等分布式训练框架,保障大规模模型训练的高效性与稳定性,支持客户侧或业务侧的微调、增量训练需求与训练环境交付。
4. 高并发服务部署与运维:设计并实现大模型的高并发推理服务架构,构建全链路监控与可观测性(Observability)系统,保障线上服务的低延迟、高吞吐与故障自愈,并面向客户生产环境制定SLA/SLO、告警策略与容灾预案。
5. 国产化算力适配:负责AI模型在国产化算力环境下的迁移与适配,基于厂商提供的适配框架与工具链完成模型部署、精度对齐、性能压测与调优,解决环境兼容性与稳定性问题,确保功能一致与性能达标,并完成客户现场的端到端验证与交付验收。
任职资格:
1. 学历与专业背景:硕士及以上学历,计算机、软件工程等相关专业;具备扎实的计算机系统、并行计算与深度学习基础。
2. 推理引擎掌握:熟悉vLLM、TensorRT-LLM、NVIDIA Triton等主流推理引擎,有算子开发、CUDA/OpenAI Triton编程或推理优化实战经验者优先。
3. 工程化与交付能力:熟练掌握Python/C++,熟悉Linux系统编程,具备高并发服务部署与性能调优经验;具备良好的客户沟通与需求抽象能力,能独立完成现场部署、问题诊断与交付闭环,有To B/To G项目交付经验者优先;了解Go者优先。
4. 加分项:有AI Infra开源项目贡献经验;熟悉LLMOps全链路;有国产化算力适配经验;有大规模智算集群调度与运维经验者优先。