Agent Skills
› langwatch/langwatch
langwatch/langwatch
GitHub用于协作式UI开发,启动可见的Chromium浏览器,通过快照与用户交互。接收视觉反馈后编辑代码并刷新验证,实现实时UI调试与修复。
Install All Skills
npx skills add langwatch/langwatch --all -g -y
Skills in Collection (33)
用于协作式UI开发,启动可见的Chromium浏览器,通过快照与用户交互。接收视觉反馈后编辑代码并刷新验证,实现实时UI调试与修复。
用户要求'browser pair'或'paired browser'
用户希望共同查看UI并获得实时视觉反馈
npx skills add langwatch/langwatch --skill browser-pair -g -y
基于Playwright MCP的交互式功能验证Skill。作为编排者,启动子代理驱动真实浏览器,解析测试参数与端口,执行数据预置及UI交互验证,并收集截图结果,适用于无需编写代码的敏捷功能验收。
需要验证前端新功能或现有特性在真实浏览器中的表现
提供功能描述或Feature文件要求进行自动化交互测试
需要快速进行冒烟测试或回归测试且不想维护测试脚本
npx skills add langwatch/langwatch --skill browser-test -g -y
针对代码变更执行项目级审查,依据12条规则检查ID生成、多租户隔离、Prisma/ClickHouse查询规范、TS类型安全及架构分层等,输出每项通过或失败详情。
用户请求代码审查
提交PR或推送代码后自动触发
npx skills add langwatch/langwatch --skill code-review -g -y
维护 LangWatch 功能地图,用于在添加新功能、API、工具或技能时更新中央注册表,确保代码与平台状态同步。
添加新平台功能
新增 API 端点
集成 MCP 工具或 CLI 命令
开发新的 Agent Skill
npx skills add langwatch/langwatch --skill feature-map -g -y
提供LangWatch本地开发环境启动的实战指南,涵盖栈状态检查、服务启动及复用本地数据库配置。重点解决WSL2代理、DNS解析失败等常见故障模式。
启动本地开发环境
排查开发环境连接问题
配置本地代理服务
npx skills add langwatch/langwatch --skill haven-setup -g -y
管理 LangWatch GitHub 项目看板,支持同步状态、查看个人任务、发现停滞项、移动议题及分配工作。
需要更新或同步 GitHub 项目看板状态时
查看当前用户分配的任务列表时
查找长时间未更新或停滞的议题时
手动移动议题状态或分配任务时
npx skills add langwatch/langwatch --skill langwatch-kanban -g -y
通过 langwatch CLI 读取 LLM 生产环境追踪数据,用于调试失败或缓慢的模型调用、查询特定 trace/session 详情及验证编码活动记录。
调试 LLM 运行失败或延迟
查询特定 trace 或 session 详情
检查编码会话是否被捕获
npx skills add langwatch/langwatch --skill langwatch -g -y
代表用户操作 GitHub,完成克隆、分支、提交、推送并创建真实 Pull Request。自动处理 Git 配置与 Token 安全,确保 PR 以用户身份提交,适用于修复代码或提交补丁场景。
用户要求打开 PR
修复仓库问题并提交
发送补丁
在 GitHub 上落地代码变更
npx skills add langwatch/langwatch --skill github -g -y
专家级AI工程顾问,审计Agent代码、追踪、评估及场景,对比最佳实践以发现差距。指导修复可观测性、提示词管理、测试和监控等问题,从低垂果实开始逐步提升Agent工程质量。
希望提升Agent开发质量
需要审计Agent代码和最佳实践
npx skills add langwatch/langwatch --skill agent-best-practices -g -y
用于深度诊断 AI Agent 在生产环境中的行为表现。通过 LangWatch CLI 分析流量、追踪失败模式、用户满意度及成本热点,并生成包含具体 Trace 链接的 HTML 报告,帮助理解 Agent 实际运行状况。
需要分析 AI Agent 生产环境行为
排查 Agent 失败模式或异常
监控 Token 成本和延迟趋势
npx skills add langwatch/langwatch --skill agent-performance -g -y
将代码库中的AI Agent连接至LangWatch平台,通过HTTP注册端点、配置场景专用认证及W3C链路追踪,使平台能基于真实Agent的Trace数据执行自动化测试与行为评估。
需要将本地或部署的AI Agent接入LangWatch进行仿真测试
请求为Agent配置HTTP端点以支持外部调用
需要打通Agent与LangWatch的认证和链路追踪
npx skills add langwatch/langwatch --skill connect-agent -g -y
分析 LangWatch 编码代理会话数据,通过评估缓存重建、压缩及成本等指标,确定上下文大小的最佳经济平衡点,生成优化报告以控制成本并提升效率。
需要优化编码代理会话的上下文大小
感觉编码代理会话成本过高或性能随上下文增长而下降
npx skills add langwatch/langwatch --skill context-sweet-spot -g -y
分析代码库与提示词,生成逼真评估数据集。通过交互式问答、预览确认,最终输出符合真实用户行为的CSV数据并上传至LangWatch。
用户请求生成或创建用于评估、测试的数据集
需要构建基准测试数据
npx skills add langwatch/langwatch --skill datasets -g -y
使用 LangWatch CLI 检查生产环境追踪数据,识别缺失输入输出、断连 Span 及元数据问题,提供修复指南并验证优化效果。
追踪数据异常或中断
追踪缺少输入/输出内容
需要排查 LLM 应用可观测性问题
npx skills add langwatch/langwatch --skill debug-instrumentation -g -y
使用 LangWatch CLI 进行生产环境 Agent 故障排查的结构化工作流。通过定位错误 Trace、检查 Span 详情及监控评估分数,快速诊断并根因分析 LLM 应用异常。
生产环境 Agent 报错或失败
需要排查 LLM 响应质量差或延迟高
Agent 行为异常需根因分析
npx skills add langwatch/langwatch --skill debug-with-langwatch -g -y
通过CLI命令驱动用户当前页面的UI交互,列出可用操作、执行带参数的调用并读取实时状态。适用于需在前端展示变更的场景,确保用户看到真实反馈,避免静默后台修改导致的信息不同步。
需要直接操作用户当前打开的网页界面
执行需在浏览器中可见的前端交互动作
读取包含未保存草稿的实时页面状态
npx skills add langwatch/langwatch --skill drive-the-ui -g -y
利用 LangWatch CLI 排查实验失败、分数回退及评估器异常。通过定位失败行、检查评估器设置,对比版本变更以识别根因(如模型、提示词或数据问题),并提供修复与预防建议。
实验运行失败
评估分数下降
回归分析
npx skills add langwatch/langwatch --skill eval-triage -g -y
提供多模态AI智能体(图像、音频、文档等)的评估方案,指导使用LangWatch设置LLM-as-judge评测及生成领域测试数据。
需要评估处理非文本输入的智能体
进行多模态输入的输出质量验证
npx skills add langwatch/langwatch --skill evaluate-multimodal -g -y
LangWatch评估请求的路由技能,用于区分实验与在线评估意图。通过解析用户上下文或交互式提问澄清需求,随后将任务分发至对应的experiments或online-evaluations子技能执行。
用户请求进行模型或提示词评估但未明确是离线实验还是在线监控
用户提出模糊的评估需求需要进一步澄清
npx skills add langwatch/langwatch --skill evaluations -g -y
用于在部署前对 Agent 进行批量测试,支持提示词与模型对比、回归测试、基准评估及 CI 质量门禁。通过构建领域数据集和运行实验来检测性能下降或改进效果,不适用于生产环境监控。
用户希望测试 Agent 表现
需要对比不同 Prompt 或模型的效果
执行回归测试以检测质量下降
建立 CI/CD 中的自动化质量门禁
npx skills add langwatch/langwatch --skill experiments -g -y
分析RAG知识库并生成包含多样化问答对、上下文及预期答案的合成评估数据集,支持LangWatch平台导入与测试。
需要为RAG系统生成测试数据
准备LangWatch实验所需的数据集
npx skills add langwatch/langwatch --skill generate-rag-dataset -g -y
自动克隆仓库、分支提交并推送代码,以 LangWatch 应用名义在 GitHub 上创建真实的 Pull Request,简化代码修复与提交流程。
用户要求打开 PR
修复仓库中的问题并提交补丁
npx skills add langwatch/langwatch --skill github -g -y
集成 LangWatch 为 AI Agent 提供全链路追踪、提示词版本管理、评估实验及模拟测试,增强可观测性与测试能力。
需要为 Agent 添加全链路追踪
需要进行提示词版本管理和评估
需要运行 Agent 模拟测试
npx skills add langwatch/langwatch --skill level-up -g -y
将自然语言查询转化为可保存并置于仪表盘的动态分析图表。流程包括发现LangWatchQL架构、编写测试SQL、生成Vega-Lite规范并保存,确保数据准确性与可视化效果。
需要构建或保存分析图表
要求将指标可视化并放置到仪表盘
npx skills add langwatch/langwatch --skill lwql-charts -g -y
配置 LangWatch 在线评估和护栏,用于生产流量监控、实时评分及同步拦截不安全请求。指导用户区分在线评估与批量测试,处理计划限制,并执行 CLI 命令创建监视器和评估器。
需要监控生产环境 AI 输出质量
需要设置实时安全护栏拦截违规内容
配置 LangWatch 在线评估规则
npx skills add langwatch/langwatch --skill online-evaluations -g -y
通过评估工作台对提示词进行优化。包括基线评分、假设验证、迭代编辑及成本对比,旨在提升模型回答质量与通过率,同时保障数据安全与用户控制权。
用户要求优化或改进提示词
从工作台的“优化此提示词”菜单项进入
希望提升机器人回答效果
npx skills add langwatch/langwatch --skill prompt-optimization -g -y
使用 LangWatch CLI 对 Agent 提示词进行版本管理和配置。支持代码库扫描、硬编码提取及模型参数优化,涵盖初始化、创建与管理流程,并指导处理免费计划限制。
管理 Agent 提示词版本
设置提示词版本控制
版本化特定提示词
创建新的提示词版本
npx skills add langwatch/langwatch --skill prompts -g -y
基于 LangWatch CLI 导出真实使用量(含缓存读写),对比不同模型供应商在当前窗口期的实际成本,识别因缺乏缓存折扣导致的隐性高成本,辅助用户做出更具经济效益的模型选型决策。
询问哪个提供商或模型更省钱
评估更换模型供应商的成本影响
分析当前工作负载在不同定价策略下的费用
npx skills add langwatch/langwatch --skill provider-cost-comparison -g -y
基于langwatch框架进行AI Agent测试,支持代码与平台双模式。涵盖场景编写、多轮对话模拟、红队安全测试及语音代理评估,提供自动化测试执行与缺陷修复建议。
测试AI Agent行为
编写Agent测试用例
对Agent进行红队攻击测试
验证语音代理功能
npx skills add langwatch/langwatch --skill scenarios -g -y
配置和排查 LangWatch CLI,涵盖登录、端点设置及项目连接问题,支持云与自托管环境,强调 CI/CD 中的安全凭证注入。
CLI 未认证
无法连接 LangWatch
连接到错误的项目
npx skills add langwatch/langwatch --skill setup-lw -g -y
用于编写CLI工具的场景测试,验证其在AI代理操作下的可用性。确保命令支持非交互运行、输出可解析且错误提示清晰,防止因交互式提示导致挂起,提升Agent友好性。
需要验证CLI工具对AI代理的兼容性
检查CLI是否存在交互式阻塞问题
测试Agent能否自主发现和使用CLI命令
npx skills add langwatch/langwatch --skill test-cli-usability -g -y
用于验证AI智能体在医疗、金融、法律等受监管领域是否仅保持观察和建议角色,避免提供处方或诊断。通过创建边界场景测试和对抗性红队测试,确保智能体遵守合规限制并包含适当免责声明。
验证AI在受监管领域的合规行为
检测AI是否越界提供专业建议
npx skills add langwatch/langwatch --skill test-compliance -g -y
为Python和TypeScript代码添加LangWatch追踪与可观测性。支持全库或特定模块的仪器化,涵盖安装SDK、读取框架文档、添加追踪代码及验证 traces 到达等步骤。
为代码添加追踪
设置可观测性
检查LLM调用日志
npx skills add langwatch/langwatch --skill tracing -g -y


