关于职位
1.控制面与平台建设:负责企业级 AI 算力基础设施控制面、用户 Portal 及自动化平台的研发与架构优化。
2.算力与资源调度:开发平台 API、后端服务及 Workflow 工作流引擎,打通 Kubernetes、GPU、网络与分布式存储,实现异构基础设施的统一管理与调度。
3.交互与用户体验:打造直观高效的 Workbench/Dashboard,将复杂的算力拓扑、集群状态与任务监控转化为易操作的产品体验。
4.仿真与 DevLab 建设:基于 Containerlab 搭建可重复的仿真实验环境,实现网络拓扑自动化配置、遥测采集与故障注入测试。
5.系统稳定性:与 MLOps 和 SRE 团队紧密协作,提升平台的自动化验证能力、可观测性及生产环境可靠性。
技能和经验要求
1.基础经验:3 -10年云原生平台、后端架构、网管系统或基础设施开发经验。
2.技术栈:精通 React / TypeScript / Node.js 或 Go / Java / Python 中至少一种主力技术栈,具备跨全栈/后端/控制面的开发与协作能力。
3.云原生深度:深入理解 Kubernetes 生态(Controller/Operator 模式、CRD、reconcile 机制),熟悉分布式系统原理与 REST/OpenAPI 设计。
4.仿真实战(加分/优先):具备 Containerlab 实战经验,能编写拓扑 YAML 并结合 Docker/K8s 部署测试环境者优先。
5.领域知识(加分):了解 GPU/HPC 调度(Slurm/Kueue)、SONiC 网络、分布式存储(Ceph/MinIO)或 MLOps 开发者优先。