Agent Skills
› OpenDCAI/DataFlow-WebUI
OpenDCAI/DataFlow-WebUI
GitHubBenchDatasetEvaluatorQuestion算子参考文档,支持基于问题和子问题的答案评估。提供匹配模式和语义模式两种对比方式,用于在数据流管道中对生成答案与标准答案进行自动化评测。
安装全部 Skills
npx skills add OpenDCAI/DataFlow-WebUI --all -g -y
集合内 Skills (23)
BenchDatasetEvaluatorQuestion算子参考文档,支持基于问题和子问题的答案评估。提供匹配模式和语义模式两种对比方式,用于在数据流管道中对生成答案与标准答案进行自动化评测。
需要评估模型生成的答案准确性
处理带有问题上下文或子问题的数据集评测
配置自动化测试流水线中的答案校验环节
npx skills add OpenDCAI/DataFlow-WebUI --skill bench-dataset-evaluator-question -g -y
BenchDatasetEvaluator算子用于基准测试中对比预测答案与标准答案,支持数学精确匹配和基于LLM的语义评估两种模式,适用于模型评测流程。
进行基准测试中的答案正确性评估
需要对比预测结果与Ground Truth
npx skills add OpenDCAI/DataFlow-WebUI --skill bench-dataset-evaluator -g -y
使用LLM对文本行进行1-5分质量评分,并将分数写入新列,保留所有原始数据。适用于需要评估文本质量但无需过滤行的场景,常与GeneralFilter配合实现两步打分和筛选流程。
需要对批量文本数据进行LLM质量评分
希望在不删除数据的情况下为每行添加评分字段
npx skills add OpenDCAI/DataFlow-WebUI --skill prompted-evaluator -g -y
Text2QASampleEvaluator 算子,利用 LLM 从问题质量、答案对齐、可验证性及下游价值四个维度评估 QA 对,生成评分与反馈。
需要自动化评估生成的 QA 对质量
在数据流水线中集成多维度 QA 评估环节
npx skills add OpenDCAI/DataFlow-WebUI --skill text2qa-sample-evaluator -g -y
用于评估模型在基准数据集上的回答质量,支持6种评估类型和LLM语义判断,生成评分及统计结果。
需要评估大模型生成的答案质量
运行基准测试集并计算准确率或相关性分数
npx skills add OpenDCAI/DataFlow-WebUI --skill unified-bench-dataset-evaluator -g -y
GeneralFilter算子参考文档,说明如何通过Lambda函数组合规则对DataFrame进行行过滤。
需要基于列值条件过滤数据行
使用Lambda表达式构建多条件AND过滤逻辑
npx skills add OpenDCAI/DataFlow-WebUI --skill general-filter -g -y
KCenterGreedyFilter算子通过K-Center Greedy算法基于语义多样性对大数据集进行下采样。支持多种Embedding服务后端,用于筛选最具代表性的样本行。
需要对数据集进行基于语义多样性的下采样
使用K-Center Greedy算法选择代表性样本
npx skills add OpenDCAI/DataFlow-WebUI --skill kcentergreedy-filter -g -y
PromptedFilter算子参考文档,说明如何通过LLM语义质量评估对数据行进行过滤。支持自定义评分标准与分数区间,用于替代简单规则过滤,提升数据筛选的智能性与准确性。
需要基于LLM语义判断对文本数据进行质量过滤
配置基于分数的数据行保留策略
npx skills add OpenDCAI/DataFlow-WebUI --skill prompted-filter -g -y
BenchAnswerGenerator 算子用于从基准测试数据集中生成模型回答,支持多种评估类型及自定义提示词模板,旨在与统一基准评估器对齐。
需要为基准测试问题行生成模型答案
准备数据以输入到 UnifiedBenchDatasetEvaluator
npx skills add OpenDCAI/DataFlow-WebUI --skill bench-answer-generator -g -y
处理超长文本的LLM生成算子。读取文件,按token限制分块调用LLM,合并结果并写入新文件,适用于内容超出上下文窗口的场景。
数据包含文件路径且需批量LLM处理
文件内容超过LLM上下文窗口限制
需要将生成结果保存为独立文本文件
npx skills add OpenDCAI/DataFlow-WebUI --skill chunked-prompted-generator -g -y
EmbeddingGenerator算子参考文档,介绍如何将DataFrame文本列批量转换为向量。涵盖构造函数、四种服务配置选项(远程API、本地模型、LiteLLM、vLLM)及运行流程,用于检索、聚类等下游任务。
需要将文本数据转换为嵌入向量
配置向量生成的服务后端
理解EmbeddingGenerator算子的参数与用法
npx skills add OpenDCAI/DataFlow-WebUI --skill embedding-generator -g -y
DataFlow框架中FormatStrPromptedGenerator算子的参考文档,说明如何将DataFrame多列映射为模板占位符构建LLM提示词并生成结果。
需要基于多个数据列生成LLM提示词
使用模板将DataFrame字段组合成单一输入
npx skills add OpenDCAI/DataFlow-WebUI --skill format-str-prompted-generator -g -y
PromptedGenerator算子参考文档,介绍其在DataFlow中用于单字段LLM生成的构造函数参数、run()签名及行处理逻辑。适用于将该算子集成至数据处理流水线的场景。
集成PromptedGenerator到DataFlow流水线
查询单字段LLM生成算子的用法和参数
npx skills add OpenDCAI/DataFlow-WebUI --skill prompted-generator -g -y
RetrievalGenerator算子用于异步读取文本列,调用LLM服务生成内容并写入新列。支持LightRAGServing后端,处理数据流中的非空行,适用于AI驱动的数据转换场景。
需要批量调用LLM生成文本内容
在数据管道中集成AI推理能力
使用LightRAGServing进行文档增强生成
npx skills add OpenDCAI/DataFlow-WebUI --skill retrieval-generator -g -y
Text2MultiHopQAGenerator算子,用于从长文本列生成多跳问答对及元数据。它读取输入文本,调用LLM生成推理式QA,将结果写入指定输出列,并过滤掉未生成QA的行,适用于需要复杂推理的问答场景。
需要从长文本生成多跳推理问答对
构建数据处理流水线中的文本转换算子
npx skills add OpenDCAI/DataFlow-WebUI --skill text2multihopqa-generator -g -y
PandasOperator用于在无LLM介入下,对DataFrame执行一系列自定义转换函数。它顺序应用处理逻辑,支持重命名、过滤、计算等纯Pandas操作,适用于数据流管道中的数据处理环节。
需要对DataFrame进行自定义清洗或转换
执行无LLM参与的批量数据处理任务
npx skills add OpenDCAI/DataFlow-WebUI --skill pandas-operator -g -y
PromptedRefiner 算子利用 LLM 对数据表中的文本列进行润色和重写,并直接覆盖原始内容。适用于需要自动化优化或规范化大量非结构化文本数据的场景。
需要对数据集中的文本字段进行质量提升
使用 LLM 批量重写或格式化文本内容
在数据处理流水线中执行基于提示词的文本清洗
npx skills add OpenDCAI/DataFlow-WebUI --skill prompted-refiner -g -y
DataFlow核心文本算子的静态参考文档,涵盖生成、过滤、优化和评估四类算子。提供API签名、执行逻辑及常见错误示例,供管道生成技能查阅以辅助开发。
查询特定文本算子的构造函数或run方法签名
查找算子的执行逻辑和返回值语义
查看算子的最佳实践或常见失败模式
npx skills add OpenDCAI/DataFlow-WebUI --skill core_text -g -y
DataFlow仓库开发助手,支持算子/Pipeline/Prompt创建、报错诊断、代码规范审查及知识库更新感知。通过按需加载参考文件提升效率,集成MCP与离线模式适配不同环境。
用户请求新建算子、Pipeline或Prompt
遇到报错需要诊断
请求代码审查或规范检查
查询API或架构问题
感知仓库变更并建议更新知识库
npx skills add OpenDCAI/DataFlow-WebUI --skill dataflow-dev -g -y
用于为DataFlow构建生产级Operator脚手架,支持交互采访或直接Spec模式。自动生成Operator代码、CLI封装、注册逻辑及单元测试/冒烟测试骨架,适用于需要快速创建数据处理算子的场景。
用户请求创建或生成新的DataFlow Operator
用户要求添加OPERATOR_REGISTRY注册逻辑
用户需要生成基于DataFlowStorage的CLI包装器
用户要求生成Operator相关的单元测试或冒烟测试
npx skills add OpenDCAI/DataFlow-WebUI --skill dataflow-operator-builder -g -y
根据目标描述和JSONL样本数据,分析数据结构并选择合适算子,生成可运行的DataFlow管道代码,支持字段依赖追踪与错误修复。
用户要求生成数据处理管道代码
需要基于JSONL数据选择算子或修复管道
npx skills add OpenDCAI/DataFlow-WebUI --skill generating-dataflow-pipeline -g -y
用于为DataFlow算子生成可复用、可审计的prompt_template类代码。通过两轮结构化采集需求,对齐算子接口,输出决策JSON与完整产物,并执行静态验收检查,支持基于反馈的定向改写。
用户请求生成或重写prompt_template
需要复用现有算子逻辑并定制新提示词
npx skills add OpenDCAI/DataFlow-WebUI --skill prompt-template-builder -g -y
用于将LLM生成的领域特定内容写入DataFrame指定列的算子。适用于已有种子DataFrame且需批量填充新列的场景,通过构建提示词调用LLM并返回结果列表。
需要向现有DataFrame批量生成领域相关文本数据
使用LLM进行单列数据的自动化填充
npx skills add OpenDCAI/DataFlow-WebUI --skill random-domain-knowledge-row-generator -g -y


