हम आपके अनुभव को बेहतर बनाने, साइट उपयोग का विश्लेषण करने और हमारे मार्केटिंग प्रयासों में सहायता के लिए कुकीज़ और समान तकनीकों का उपयोग करते हैं। गोपनीयता नीति
पोस्ट का समय:
我们在寻找怎样的人才 (Who we are looking for): ・对大模型落地运维真实业务场景充满热情,具备工程化落地思维。 ・擅长跨团队协同,和平台、运维团队对齐业务目标。 ・Work Smart, Play Smart! 你将负责的工作 (What you'll do): ・负责 AIOps 智能运维平台整体稳定性建设,保障大模型、Agent、算法服务生产环境可靠运行。 ・打通 AI 算法与真实运维业务场景,参与故障演练、真实故障复盘,提炼业务需求反哺产品与算法迭代。 ・负责平台、大模型服务、向量库、大数据组件的部署、监控、容量规划、故障应急处置。 ・落地运维自动化脚本与工具链,对接 AIOps 平台能力,推动智能化运维能力在生产环境落地实践。 ・评估 AI 运维能力的生产风险,制定运维 SOP,建设观测告警体系,保障 AI 能力安全可控上线。 如果你具备以下条件,你将是合适的人选 (You'll be a good fit if you have/are any of below): ・拥有计算机科学、软件工程、信息技术或相关领域的学士及以上学位。 ・具备 SRE / 云原生运维实战经验,熟悉大型生产平台稳定性保障体系。 ・具备以下任何一项专业知识和经验者将获优先考虑: ・精通 Kubernetes 生态,熟练掌握容器、微服务部署运维。 ・熟悉 Prometheus、Grafana、OpenTelemetry 等可观测体系,具备故障排查实战能力。 ・有大数据组件、向量数据库、大模型推理服务运维经验优先。 ・熟悉脚本开发 (Python/Shell),具备自动化工具开发能力。 ・了解 AIOps、智能运维业务,能够理解大模型、Agent 技术的能力边界。 ・具备出色的逻辑分析能力和解决复杂问题的能力。 ・将根据申请人的相关工作经验分配至不同的核心项目。 ・能够展示 AI 相关知识,或有在工作中使用生成式 AI 工具(Generative AI tools)经验和能力的候选人将获优先考虑。