阿里云 STAROps 全域智能运维平台的最佳实践汇总:从上手、场景能力到 DevOps 闭环、持续优化与集成扩展。
STAROps 内置 InvestigationAgent 适合处理根因方向未知的问题。它可以从一条告警出发,动态探索指标、日志、Trace、拓扑、资源、变更和关联实体,逐步补齐证据链。对于复杂故障、多因素叠加或告警主体不清晰的场景,Inv
查看文档容量风险巡检用于在资源触达阈值前识别风险,并把预测结果转成可运营的容量事件。它关注未来窗口:按当前趋势、季节性和业务增长速度,哪些对象会触达阈值,哪些业务链路会被共同上升的负载拖入风险。 在 STAROps 中设计并部署自定义容量风险巡检
查看文档当您需要对核心业务服务(订单、支付、登录等)做定期可靠性评估,判断业务指标是否偏离正常范围、并在偏离时定位到具体的应用层与依赖层根因时,可以在 STAROps 里按 5 个 Phase 串起来:业务指标基线 应用指标关联 依赖拓扑分析 告警
查看文档本实践把核心 Logstore 的日志模式定期纳入主动巡检:场景卡建任务、数字员工对话内编排配置,cron 周期触发模式聚类与基线对比,报告归档并送达通知通道。 适用范围: 巡检对象:单 Logstore,或 2 至 5 个 Logstor
查看文档很多团队在进行云产品巡检时,通常先从单一产品开始,但随着云产品接入的越来越多,还会遇到后续问题: 本轮哪些产品已经完成巡检,哪些产品缺失、过期或只完成了一部分。 多份报告里的异常是否指向同一个资源、同一条业务链路或同一个责任范围。 某个产品
查看文档本文面向使用 STAROps 查询云费用、定位费用变化、分析资源水位和获取优化建议的用户。用户只需用自然语言描述目标,无需编写 SQL 或执行 CLI 命令。 示例数据说明 本文示例中的金额、比例、指标和实例均为虚构的整千、整万或整十数据,
查看文档告警诊断通常先定位到运行时对象,例如应用服务、接口、Pod、云资源或调用链。要继续判断哪次发布、哪个代码仓库、哪位负责人和本次异常相关,还需要把 DevOps 域数据纳入运行时上下文。 本文介绍如何通过 UModel 接入 DevOps 数
查看文档查看 DevOps 闭环演示视频 您的浏览器不支持 video 标签。 DevOps 任务经常从代码开始,却在发布、告警、日志、Trace 和运行环境之间中断。开发者需要在不同平台重复确认版本、对象、时间范围和诊断结论,Agent 也难以保
查看文档在 STAROps 中,周期性巡检用于对云资源、应用依赖和关键业务对象进行定期健康检查。一次有效巡检应输出当前水位、异常项、长周期趋势、证据来源和后续调查方向,帮助运维团队提前发现容量、性能、安全和稳定性风险。 巡检的直接收益包括: 统一巡
查看文档本规范定义 STAROps 运维 Skill 的 7 要素,用于将 RDS 巡检、告警根因定位、日志模式分析等重复运维操作沉淀为可加载技能。 适用范围: 自研 Skill 的设计期评审标准 第三方 Skill 引入前的合规审查清单 适用类型
查看文档本规范定义 STAROps Skill 中数值计算的确定性脚本写法,保证同输入同输出。 模型推理在两类计算上不可靠: 单位换算:同一会话内两遍可能给出 1024 进制(1.00GB)或 1000 进制(1.07GB)不同答案 阈值与持续时间
查看文档