We use cookies and similar technologies to improve your experience, analyze site usage, and assist in our marketing efforts. Privacy Policy
Post time:
我们在寻找怎样的人才 (Who we are looking for): ・对大模型落地运维真实业务场景充满热情,具备工程化落地思维。 ・擅长跨团队协同,和平台、运维团队对齐业务目标。 ・Work Smart, Play Smart! 你将负责的工作 (What you'll do): ・负责 AIOps 智能运维平台整体稳定性建设,保障大模型、Agent、算法服务生产环境可靠运行。 ・打通 AI 算法与真实运维业务场景,参与故障演练、真实故障复盘,提炼业务需求反哺产品与算法迭代。 ・负责平台、大模型服务、向量库、大数据组件的部署、监控、容量规划、故障应急处置。 ・落地运维自动化脚本与工具链,对接 AIOps 平台能力,推动智能化运维能力在生产环境落地实践。 ・评估 AI 运维能力的生产风险,制定运维 SOP,建设观测告警体系,保障 AI 能力安全可控上线。 如果你具备以下条件,你将是合适的人选 (You'll be a good fit if you have/are any of below): ・拥有计算机科学、软件工程、信息技术或相关领域的学士及以上学位。 ・具备 SRE / 云原生运维实战经验,熟悉大型生产平台稳定性保障体系。 ・具备以下任何一项专业知识和经验者将获优先考虑: ・精通 Kubernetes 生态,熟练掌握容器、微服务部署运维。 ・熟悉 Prometheus、Grafana、OpenTelemetry 等可观测体系,具备故障排查实战能力。 ・有大数据组件、向量数据库、大模型推理服务运维经验优先。 ・熟悉脚本开发 (Python/Shell),具备自动化工具开发能力。 ・了解 AIOps、智能运维业务,能够理解大模型、Agent 技术的能力边界。 ・具备出色的逻辑分析能力和解决复杂问题的能力。 ・将根据申请人的相关工作经验分配至不同的核心项目。 ・能够展示 AI 相关知识,或有在工作中使用生成式 AI 工具(Generative AI tools)经验和能力的候选人将获优先考虑。