CnOps 智能运维与可观测社区
首页开源项目实践文章视频课程常见问答开发者工具STAROps 专题
导航菜单
首页开源项目实践文章视频课程常见问答开发者工具STAROps 专题

CnOps 智能运维与可观测社区



愿景

CnOps 智能运维与可观测社区是一个以"智能运维与可观测"为核心的开放、包容、分享的技术社区,旨在聚集运维专家、开发者和爱好者,共同探讨、学习和分享可观测最佳实践与最新技术,与众多技术社区合作互动,共同探讨交叉领域的技术挑战,推动可观测领域的创新与进步。

内容社区

  • 实践文章
  • 视频课程
  • 开源项目
  • 常见问答
  • 开发者工具

友情链接

  • Prometheus
  • Grafana Lab
  • OpenTelemetry
  • LoongCollector

关注我们

阿里云云原生公众号阿里云云原生
阿里云可观测公众号阿里云可观测

Copyright © 2026 CnOps 社区. All rights reserved.

STAROps 专题

阿里云 STAROps 全域智能运维平台的最佳实践汇总:从上手、场景能力到 DevOps 闭环、持续优化与集成扩展。

开始上手


与 STAROps 有效对话

在 STAROps 中,提问方式会影响 Agent 取哪些数据、调用哪些 Skill、关联哪些 UModel 实体。明确实体、时间窗、业务意图和期望输出,可以让 Agent 更快收敛到可验收结论。系统慢这类笼统描述会扩大搜索范围,增加反复补

查看文档

场景能力


告警 RCA 多分支诊断最佳实践

STAROps 内置 InvestigationAgent 适合处理根因方向未知的问题。它可以从一条告警出发,动态探索指标、日志、Trace、拓扑、资源、变更和关联实体,逐步补齐证据链。对于复杂故障、多因素叠加或告警主体不清晰的场景,Inv

查看文档

自定义容量风险巡检设计最佳实践

容量风险巡检用于在资源触达阈值前识别风险,并把预测结果转成可运营的容量事件。它关注未来窗口:按当前趋势、季节性和业务增长速度,哪些对象会触达阈值,哪些业务链路会被共同上升的负载拖入风险。 在 STAROps 中设计并部署自定义容量风险巡检

查看文档

业务服务可靠性巡检

当您需要对核心业务服务(订单、支付、登录等)做定期可靠性评估,判断业务指标是否偏离正常范围、并在偏离时定位到具体的应用层与依赖层根因时,可以在 STAROps 里按 5 个 Phase 串起来:业务指标基线 应用指标关联 依赖拓扑分析 告警

查看文档

日志模式定时巡检

本实践把核心 Logstore 的日志模式定期纳入主动巡检:场景卡建任务、数字员工对话内编排配置,cron 周期触发模式聚类与基线对比,报告归档并送达通知通道。 适用范围: 巡检对象:单 Logstore,或 2 至 5 个 Logstor

查看文档

多云产品融合巡检最佳实践

很多团队在进行云产品巡检时,通常先从单一产品开始,但随着云产品接入的越来越多,还会遇到后续问题: 本轮哪些产品已经完成巡检,哪些产品缺失、过期或只完成了一部分。 多份报告里的异常是否指向同一个资源、同一条业务链路或同一个责任范围。 某个产品

查看文档

账单与成本分析最佳实践

本文面向使用 STAROps 查询云费用、定位费用变化、分析资源水位和获取优化建议的用户。用户只需用自然语言描述目标,无需编写 SQL 或执行 CLI 命令。 示例数据说明 本文示例中的金额、比例、指标和实例均为虚构的整千、整万或整十数据,

查看文档

DevOps 闭环


使用 UModel 接入 DevOps 数据并追因到代码变更

告警诊断通常先定位到运行时对象,例如应用服务、接口、Pod、云资源或调用链。要继续判断哪次发布、哪个代码仓库、哪位负责人和本次异常相关,还需要把 DevOps 域数据纳入运行时上下文。 本文介绍如何通过 UModel 接入 DevOps 数

查看文档

一个 Agent 入口完成 DevOps 闭环

查看 DevOps 闭环演示视频 您的浏览器不支持 video 标签。 DevOps 任务经常从代码开始,却在发布、告警、日志、Trace 和运行环境之间中断。开发者需要在不同平台重复确认版本、对象、时间范围和诊断结论,Agent 也难以保

查看文档

持续优化


如何提升巡检稳定性,同时支持异常后的动态追因

在 STAROps 中,周期性巡检用于对云资源、应用依赖和关键业务对象进行定期健康检查。一次有效巡检应输出当前水位、异常项、长周期趋势、证据来源和后续调查方向,帮助运维团队提前发现容量、性能、安全和稳定性风险。 巡检的直接收益包括: 统一巡

查看文档

编写 STAROps 运维 Skill

本规范定义 STAROps 运维 Skill 的 7 要素,用于将 RDS 巡检、告警根因定位、日志模式分析等重复运维操作沉淀为可加载技能。 适用范围: 自研 Skill 的设计期评审标准 第三方 Skill 引入前的合规审查清单 适用类型

查看文档

编写 Skill 确定性脚本

本规范定义 STAROps Skill 中数值计算的确定性脚本写法,保证同输入同输出。 模型推理在两类计算上不可靠: 单位换算:同一会话内两遍可能给出 1024 进制(1.00GB)或 1000 进制(1.07GB)不同答案 阈值与持续时间

查看文档

集成扩展


集成钉钉 IM 通道

当您希望在钉钉中直接与 STAROps 数字员工对话——例如在单聊中查询可观测数据、在群内 @机器人发起告警诊断时,您可以按照本文完成钉钉应用创建、AppFlow 连接流配置和机器人发布。 安装 Skill 本实践配套一份 SOP Skil

查看文档

MCP 能力扩展与工具治理

STAROps 通过指标、日志、APM、Trace、Events 和 UModel 组织运行时证据。生产排障中还有一类能力来自客户侧外部系统,例如客户网络位置的主动探测、Kubernetes 操作面、GitLab 变更上下文、CMDB、工单

查看文档