Agent Skills
› langwatch/langwatch
langwatch/langwatch
GitHub提供协作式有头浏览器会话,用于UI开发。通过Playwright启动可见的Chromium,处理认证后与用户实时互动,根据视觉反馈修改代码并刷新验证,实现UI结对编程。
Install All Skills
npx skills add langwatch/langwatch --all -g -y
Skills in Collection (37)
提供协作式有头浏览器会话,用于UI开发。通过Playwright启动可见的Chromium,处理认证后与用户实时互动,根据视觉反馈修改代码并刷新验证,实现UI结对编程。
用户说'browser pair'或'paired browser'
用户要求'let's look at this together'或'open chromium'
需要迭代UI并获得实时视觉反馈
npx skills add langwatch/langwatch --skill browser-pair -g -y
通过 Playwright MCP 驱动真实浏览器进行交互式功能验证。自动解析端口与测试场景,生成数据预置清单并委派子代理执行 UI 操作与截图,实现无需编写测试代码的敏捷特性验收。
用户要求验证特定功能的 UI 表现
提供 feature 文件或描述需进行交互式冒烟测试
npx skills add langwatch/langwatch --skill browser-test -g -y
执行项目级代码审查,依据12条规范检查代码变更。涵盖ID生成、多租户隔离、Prisma/ClickHouse查询约束、类型安全、架构分层及命名等规则,输出每项通过的判定或具体违规位置。
需要检查代码变更是否符合团队规范
审查Pull Request中的代码质量与架构合规性
npx skills add langwatch/langwatch --skill code-review -g -y
维护 LangWatch 功能地图,同步代码与平台表面,确保 SDK、CLI、MCP 工具等注册信息一致。
添加新功能或 API
更新 MCP 工具或 CLI 命令
npx skills add langwatch/langwatch --skill feature-map -g -y
指导启动 LangWatch 本地开发环境,包含检查状态、一键启动及复用本地数据库。重点处理 WSL2 DNS 故障、代理端口动态获取及 CA 信任等常见陷阱。
启动本地开发服务
解决 WSL2 网络或 DNS 问题
配置本地代理与证书
npx skills add langwatch/langwatch --skill haven-setup -g -y
管理 LangWatch GitHub 项目看板,支持同步状态、查看个人任务、识别停滞项及移动或分配议题。
需要更新 GitHub 项目看板状态时
查询当前用户分配的议题列表时
查找长期未更新的停滞议题时
手动移动议题到不同状态时
将议题分配给当前用户时
npx skills add langwatch/langwatch --skill langwatch-kanban -g -y
通过 langwatch CLI 读取 LLM 生产环境追踪数据,用于调试失败或缓慢的模型调用、查询会话详情及验证代码活动捕获。
调试失败的 LLM 运行
排查缓慢的 LLM 调用
查询特定 ID 的追踪或会话
检查编码会话的活动是否被捕获
npx skills add langwatch/langwatch --skill langwatch -g -y
代表用户操作 GitHub,完成克隆、分支、提交、推送并创建真实 Pull Request。自动处理 Git 配置与 Token 安全,确保 PR 以用户身份提交,适用于修复代码或提交补丁场景。
用户要求打开 PR
修复仓库问题并提交
发送补丁
在 GitHub 上落地代码变更
npx skills add langwatch/langwatch --skill github -g -y
作为专家级AI工程顾问,审计Agent代码库、追踪记录与评估场景,对比最佳实践以识别差距。提供从快速修复到深度优化的指导,涵盖可观测性、提示词管理及测试等核心领域。
需要提升Agent工程质量和规范性时
希望审计现有Agent开发流程并获取改进建议时
npx skills add langwatch/langwatch --skill agent-best-practices -g -y
通过LangWatch CLI分析AI Agent生产环境的流量、成本、延迟及失败模式,生成包含真实Trace链接的诊断报告,帮助定位问题并优化Agent行为。
需要诊断AI Agent在生产环境中的表现
分析Agent的Token消耗热点或延迟问题
排查用户不满意或失败的Trace案例
npx skills add langwatch/langwatch --skill agent-performance -g -y
用于修改用户代码,支持本地或GitHub操作。涵盖追踪、SDK集成、参数调整及错误修复等场景,通过code_access获取上下文后执行文件读写与编辑任务。
需要修改用户程序代码
接入追踪或SDK
修复Agent失败场景
添加运行参数
版本化提示词
npx skills add langwatch/langwatch --skill code-changes -g -y
分析 LangWatch 编码代理会话数据,通过计算缓存重建、压缩及成本等指标,找出上下文大小与收益的平衡点,提供优化报告以降低高成本或性能下降问题。
编码代理会话成本过高
会话性能随上下文增长而下降
npx skills add langwatch/langwatch --skill context-sweet-spot -g -y
将自然语言问题转化为可渲染的 React 仪表板组件,通过 LangWatchQL 查询数据。涵盖发现分析模式、编写 SQL 查询、生成组件代码并验证渲染流程,适用于构建自定义图表或复杂可视化需求。
需要创建自定义仪表板组件
标准保存的图表无法满足展示需求
根据问题生成带查询的 React 小部件
npx skills add langwatch/langwatch --skill dashboard-widgets -g -y
交互式生成逼真评估数据集。通过分析代码库、提示词和日志,询问澄清问题,制定计划并预览样本,最终上传至 LangWatch。确保数据贴合真实用户场景,避免通用内容。
生成评估数据集
创建测试数据
构建基准测试集
npx skills add langwatch/langwatch --skill datasets -g -y
使用 LangWatch CLI 检查生产环境追踪数据,诊断输入输出缺失、跨度断开及元数据遗漏等问题,并提供修复指南与验证方法。
追踪数据不完整或为空
排查链路断开问题
优化追踪元数据配置
npx skills add langwatch/langwatch --skill debug-instrumentation -g -y
利用 LangWatch CLI 进行生产环境 Agent 故障排查。通过定位错误 Trace、检查 Span 细节及监控评分,逐步缩小范围以找到根因,适用于处理报错、回答错误或延迟异常等问题。
生产环境出现错误日志或失败请求
Agent 产生不良回答或幻觉
系统出现延迟 spikes
npx skills add langwatch/langwatch --skill debug-with-langwatch -g -y
驱动用户当前打开页面的实时 UI 操作,列出并接受页面动作,通过键入负载调用并读取包括未保存编辑在内的实时状态。适用于需要在前端直接操作的评估工作台等场景。
用户正在查看可操作的页面(如评估工作台)
需要在用户面前执行 UI 变更而非后台处理
需要读取页面实时状态或未保存的草稿
npx skills add langwatch/langwatch --skill drive-the-ui -g -y
使用 LangWatch 排查实验失败或评分下降问题,定位具体行和评估器得分,分析执行错误与评分回归原因,追溯根本原因并验证修复。
实验运行失败
评估分数下降
需要定位回归的根本原因
npx skills add langwatch/langwatch --skill eval-triage -g -y
指导如何评估处理图像、音频及文档等多模态输入的AI智能体。提供基于LangWatch的LLM-as-judge评测方案,涵盖不同模态的设置与测试数据生成方法。
需要评估多模态AI代理
处理非文本输入如图片或PDF
设置多模态测试场景
npx skills add langwatch/langwatch --skill evaluate-multimodal -g -y
LangWatch评估请求的路由技能,用于区分预部署实验与生产在线评估。通过意图分类将请求分发至experiments或online-evaluations子技能,若意图模糊则向用户提问确认,避免默认行为。
用户请求进行模型或提示词评估但未明确是离线测试还是线上监控
用户输入模糊的评估指令如'make me an eval'
需要路由评估任务到专用处理流程时
npx skills add langwatch/langwatch --skill evaluations -g -y
用于在部署前对 Agent 进行批量测试,支持提示词与模型对比、回归检测及 CI 质量门禁。通过构建领域数据集和运行评估实验,衡量输出质量并推荐改进。
测试 Agent 性能
比较不同 Prompt 或模型效果
检测代码变更导致的回归问题
建立 CI/CD 中的自动化质量门禁
npx skills add langwatch/langwatch --skill experiments -g -y
用于在 Trace Explorer 中查找、过滤和计数 traces。将用户描述的概念转换为查询过滤器,支持直接展示结果或作为其他任务的数据源步骤。
用户要求查找特定概念的 traces
需要筛选或统计 traces
npx skills add langwatch/langwatch --skill find-traces -g -y
分析RAG知识库内容,生成包含多种问题类型(事实、推理、对比等)的合成评估数据集。支持导出为CSV或DataFrame格式,用于LangWatch实验及RAG管道测试,确保答案准确性与覆盖度。
需要为RAG系统生成测试数据
创建RAG评估数据集
准备LangWatch实验数据
npx skills add langwatch/langwatch --skill generate-rag-dataset -g -y
自动化在GitHub仓库中执行克隆、分支创建、代码提交及推送,并代为发起Pull Request。支持通过LangWatch App令牌免密操作,自动处理Git配置与PR创建流程,适用于用户请求修复代码或提交补丁的场景。
用户要求打开Pull Request
用户要求在仓库中修复问题并提交更改
用户要求发送补丁或落地代码变更
npx skills add langwatch/langwatch --skill github -g -y
在 Langy 面板中根据用户注册选择的路径(如 Evals、Coding agents 等)自动完成配置设置,无需用户离开面板。
Guided onboarding kickoff
Let's set up ... then.
npx skills add langwatch/langwatch --skill guided-onboarding -g -y
为 AI Agent 集成 LangWatch,实现全链路追踪、提示词版本管理、评估实验及模拟测试。提供分步实施指南与顾问模式,帮助用户建立全面的可观测性与测试体系,优化 Agent 性能。
用户希望为 Agent 添加追踪功能
需要设置提示词版本控制
要求进行评估实验或模拟测试
寻求 Agent 的可观测性解决方案
npx skills add langwatch/langwatch --skill level-up -g -y
将自然语言问题转化为LangWatchQL分析图表并放置于仪表盘。流程包括发现数据Schema、编写含保留参数的SQL、创建Vega-Lite规范图表及验证运行结果,确保指标可视化准确更新。
用户要求构建或保存分析图表
用户需要将指标展示在仪表盘中
npx skills add langwatch/langwatch --skill lwql-charts -g -y
配置 LangWatch 在线评估与护栏,用于生产环境流量监控、质量评分及安全拦截。适用于实时追踪评分或同步阻断不安全请求,不适用于批量实验测试。
配置生产环境在线评估
设置安全护栏规则
监控实时流量质量
拦截不安全的请求或响应
npx skills add langwatch/langwatch --skill online-evaluations -g -y
在评估工作台通过闭环迭代优化 Prompt。自动基线评分、假设失败行、编辑副本、运行对比,直至指标达标。全程自主执行,不中断用户,确保原始数据不受损。
用户要求优化或改进 Prompt
从工作台的“优化此 Prompt”菜单项进入
希望提升 Bot 回答质量
npx skills add langwatch/langwatch --skill prompt-optimization -g -y
使用 LangWatch CLI 管理 Agent Prompt 的版本控制。支持全局扫描硬编码 Prompt 并迁移至托管格式,或针对特定 Prompt 进行版本更新。包含初始化、创建管理及代码集成步骤,并强调遵循文档与处理免费计划限制。
用户请求设置 Prompt 版本控制
用户请求对特定 Prompt 进行版本化管理
需要将硬编码的 Prompt 字符串迁移到 LangWatch 托管系统
npx skills add langwatch/langwatch --skill prompts -g -y
该技能用于将用户实际的 LangWatch 使用量(含缓存读写)与竞品价格进行对比,评估更换模型或提供商的真实成本节省情况。
询问是否更换更便宜的模型或提供商能省钱
需要基于实际用量计算不同供应商的成本
npx skills add langwatch/langwatch --skill provider-cost-comparison -g -y
配置 LangWatch CLI 认证与环境,涵盖云/自托管登录、端点设置及 CI 集成,解决连接与项目选择问题。
LangWatch CLI 未认证
无法连接到 LangWatch
CLI 连接了错误的项目
npx skills add langwatch/langwatch --skill setup-lw -g -y
编写场景测试以验证CLI工具对AI代理的可用性,确保非交互式运行、输出可解析且错误信息清晰。
验证CLI是否适合AI代理操作
检查命令是否存在交互式阻塞问题
npx skills add langwatch/langwatch --skill test-cli-usability -g -y
用于验证AI代理在医疗、金融和法律等受监管领域是否遵守合规边界,防止提供处方性建议。通过创建免责声明场景测试和对抗性红队测试,确保代理仅提供信息和建议咨询专业人士。
需要测试AI代理在受监管领域的行为合规性
验证AI代理是否提供禁止的处方性或诊断性建议
构建针对特定领域(如医疗、法律)的边界测试用例
npx skills add langwatch/langwatch --skill test-compliance -g -y
为代码添加 LangWatch 追踪与可观测性,支持 Python/TypeScript。涵盖全库或特定模块的集成指南读取、SDK 安装及代码植入,确保框架兼容性。
需要为项目添加追踪功能
请求设置可观测性
询问如何集成 LangWatch
npx skills add langwatch/langwatch --skill tracing -g -y
将代码库中的 AI Agent 连接至 LangWatch 仿真平台,通过安装 SDK 并添加连接函数,使测试套件能直接针对真实 Agent 进程运行,以验证其行为和追踪数据。
用户希望使用 LangWatch 对真实 Agent 进行仿真测试
需要将现有 Agent 集成到 LangWatch 平台以运行场景测试
npx skills add langwatch/langwatch --skill connect-agent -g -y
基于 langwatch 框架进行 AI Agent 模拟测试、红队攻防及自动化评估。支持代码与平台两种模式,自动检测上下文并执行测试,提供详细报告与改进建议。
测试 AI Agent
编写场景测试代码
创建平台场景
安全红队测试
npx skills add langwatch/langwatch --skill scenarios -g -y
Dependencies:
langwatch/skills/connect-agent


