Agent Skills
› OpenDCAI/DataFlow-WebUI
› pandas-operator
pandas-operator
GitHubPandasOperator用于在数据流中顺序应用自定义DataFrame转换函数,支持读取、链式处理及写入存储。适用于无需LLM介入的纯Pandas数据处理场景。
Trigger Scenarios
需要执行一系列自定义的DataFrame转换逻辑
构建基于Pandas的数据处理流水线
Install
npx skills add OpenDCAI/DataFlow-WebUI --skill pandas-operator -g -y
SKILL.md
Frontmatter
{
"name": "pandas-operator",
"description": "Reference documentation for the PandasOperator operator.\nUse when: applying custom DataFrame transformations without LLM."
}
PandasOperator Operator Reference
PandasOperator applies a list of transformation functions to a DataFrame sequentially. Each function receives a DataFrame and returns a modified DataFrame.
1. Import
from dataflow.operators.core_text import PandasOperator
2. Constructor
PandasOperator(
process_fn=[
lambda df: df.rename(columns={"old": "new"}),
lambda df: df[df["score"] > 0],
]
)
| Parameter | Required | Default | Description |
|---|---|---|---|
process_fn |
Yes | None | List of transformation functions, each with signature (df: DataFrame) -> DataFrame |
3. run() Signature
op.run(
storage=self.storage.step(),
)
# returns: empty string ""
| Parameter | Required | Default | Description |
|---|---|---|---|
storage |
Yes | None | Storage step object |
4. Usage Example
from dataflow.operators.core_text import PandasOperator
from dataflow.utils.storage import FileStorage
class MyPipeline:
def __init__(self):
self.storage = FileStorage(
first_entry_file_name="./data/input.jsonl",
cache_path="./cache",
file_name_prefix="step",
cache_type="jsonl"
)
self.transformer = PandasOperator(
process_fn=[
lambda df: df.assign(score2=df["score"] * 2),
lambda df: df.sort_values("score", ascending=False),
lambda df: df.drop(columns=["temp_col"])
]
)
def forward(self):
self.transformer.run(
storage=self.storage.step()
)
if __name__ == "__main__":
pipeline = MyPipeline()
pipeline.forward()
5. Runtime Logic
- Read DataFrame from storage.
- Apply each function in
process_fnsequentially. - Each function receives the output DataFrame from the previous function.
- Validate each function is callable and returns a DataFrame.
- Write final DataFrame to storage.
- Return empty string.
6. Important Notes
- Each function in
process_fnmust return apd.DataFrame - Functions are applied in list order
- No
input_keyoroutput_keyparameters (column operations are in lambda functions) - Does not call LLM (pure pandas operations)
Version History
- 2e95d40 Current 2026-08-27 09:04


