Agent Skills
› xberg-io/xberg
xberg-io/xberg
GitHub管理Alef生成的跨语言绑定代码。指导通过alef.toml配置和Rust源码修改来生成、验证及同步各语言绑定,严禁手动编辑,需原子提交并处理生成冲突。
Install All Skills
npx skills add xberg-io/xberg --all -g -y
Skills in Collection (40)
管理Alef生成的跨语言绑定代码。指导通过alef.toml配置和Rust源码修改来生成、验证及同步各语言绑定,严禁手动编辑,需原子提交并处理生成冲突。
需要生成或重新生成跨语言绑定代码
修改alef.toml配置以调整绑定行为
在packages或binding crates中进行开发
验证生成文件的最新状态
npx skills add xberg-io/xberg --skill alef-generated-bindings -g -y
管理基准测试工作流,涵盖提取基准、质量评分及断言契约。指导如何维护独立源真值、诊断运行故障(区分基础设施与提取问题)及验证结果,确保评估准确性。
需要运行或诊断基准测试时
修改基准夹具或质量评分逻辑时
排查提取器或OCR质量问题时
npx skills add xberg-io/xberg --skill benchmark-workflow -g -y
文档文本分块与向量嵌入生成技能,支持多种分块策略及RAG集成。修正了旧版中不存在的API描述和错误配置,同步代码实际实现,移除无效指标。
需要处理文本分块逻辑
生成或管理文本嵌入向量
构建或调试RAG数据管道
npx skills add xberg-io/xberg --skill chunking-embeddings -g -y
描述 Xberg 配置加载与优先级规则,涵盖 CLI/Server 模式、文件发现、JSON 合并及静默失败机制。用于配置调试或修改时的参考。
添加配置标志或环境变量
更改配置优先级
调试设置未生效问题
npx skills add xberg-io/xberg --skill config-loading-precedence -g -y
描述 Xberg Rust 工作区结构,包括核心库、多语言绑定及排除项。用于导航代码、确定归属及新增 crate 配置。
需要理解仓库整体架构
决定代码所属模块
添加新的 workspace crate
npx skills add xberg-io/xberg --skill crate-structure -g -y
描述Xberg提取管道的核心编排逻辑,涵盖格式检测、提取器路由、降级策略及后处理流程。用于调试或优化多格式文档提取的流水线行为,而非单一解析器的语法细节。
需要诊断或修改文档提取流水线的编排逻辑
分析格式检测、缓存语义、提取器回退机制或并发默认配置
排查跨多种文件格式的质量不变性问题
npx skills add xberg-io/xberg --skill extraction-pipeline-patterns -g -y
定义xberg crate的Cargo特性标志策略,处理WASM/Android x86_64等平台的ORT不兼容问题,提供纯Rust类型、Tract推理变体及平台安全替代方案。
配置或调试Cargo特性标志
解决WASM或Android模拟器构建依赖问题
分析跨平台编译兼容性
npx skills add xberg-io/xberg --skill feature-flag-policy -g -y
提供MIME类型检测、提取器路由及格式注册表的开发指南。涵盖路径与字节检测逻辑、优先级选择、通配符支持,以及新增格式的标准化流程,用于调试路由错误或扩展系统能力。
添加新的文件格式支持
调试文件路由到错误提取器的问题
配置提取器与MIME类型的映射
npx skills add xberg-io/xberg --skill mime-detection-routing -g -y
用于评估和优化OCR流水线,涵盖后端切换、预处理、缓存策略及结构重建。支持A/B质量测试与精度验证,不处理普通PDF文本提取。
OCR后端行为变更或评估
A/B质量对比工作
OCR流程配置调整
npx skills add xberg-io/xberg --skill ocr-pipeline-and-quality -g -y
指导 Xberg PDF 引擎的后端配置、选择与诊断,涵盖 Native 和 Pdfium 两种后端的使用规范、OCR 回退机制及渲染会话管理。
PDF 提取或渲染问题排查
Native/Pdfium 后端切换配置
加密文档处理
OCR 回退策略调整
npx skills add xberg-io/xberg --skill pdf-backends -g -y
指导 Xberg 插件系统的架构设计、类型定义、注册机制、优先级冲突处理及生命周期管理,涵盖 Rust 原生提取器与 Python 桥接实现。
设计新的插件类型或 trait
实现文档提取器或后端插件
诊断插件注册冲突或优先级问题
配置插件生命周期回调
npx skills add xberg-io/xberg --skill plugin-architecture-patterns -g -y
用于判定跨仓库修复或 API 的归属权,协调 Xberg、Alef 等兄弟仓库间的兼容变更,明确各仓库职责边界与发布顺序。
需要修复涉及多个独立 Git 仓库的问题
设计跨仓库共享的公共 API
npx skills add xberg-io/xberg --skill polyrepo-boundaries -g -y
发布前就绪审计技能,用于在推送或发布前协调CI、发布试运行、基准测试及版本状态。通过检查工作流失败、验证生成输出和分发制品,确保提交符合发布标准,作为发布流程的准入关卡。
准备进行代码推送或软件发布
需要审计当前分支的发布就绪状态
npx skills add xberg-io/xberg --skill release-readiness -g -y
说明 xberg 版本同步与发布流程。以 Cargo.toml 为唯一真相源,通过 task version:sync 自动同步至绑定文件和集成包,确保核心与集成锁步发布。
需要更新或同步项目版本号
查看版本同步机制或集成发布规则
执行版本 bump 或 set 操作
npx skills add xberg-io/xberg --skill release-versioning -g -y
指导如何获取、使用及维护 Rust 项目的测试文档语料库。涵盖 fixture 加载、缺失诊断、A/B 控制设置及发布流程,避免构建与测试陷阱。
运行 Rust 测试前需加载测试数据
诊断测试因缺少文件而失败
配置 A/B 测试控制组
发布或更新测试语料库
npx skills add xberg-io/xberg --skill test-corpus -g -y
定义WASM构建约束,包括同步API、无Tokio、2MB HTML限制及尺寸优化。指导WASM目标开发、提取器适配及构建配置。
构建WASM目标
添加或修改WASM兼容的提取器
调试WASM构建或运行时故障
npx skills add xberg-io/xberg --skill wasm-constraints -g -y
针对Xberg仓库的TypeScript/JavaScript开发规范,涵盖pnpm工作区管理、Vitest测试、oxlint格式化及napi-rs/wasm构建边界,指导包依赖与工具链使用。
修改TS/JS包代码或配置
执行项目级Lint、Format或Typecheck
运行Vitest测试套件
处理pnpm工作区依赖或集成包构建
npx skills add xberg-io/xberg --skill xberg-typescript-toolchain -g -y
批量提取技能,支持多文件并行处理、共享配置、单文件覆盖及错误恢复。通过xberg batch命令实现高效文档解析,适用于大规模数据预处理和LLM摄入场景。
需要同时处理多个文件的批量操作
对并发控制和错误容忍度有要求的文档提取任务
npx skills add xberg-io/xberg --skill batch-extraction -g -y
提供文档分块能力,支持字符/Token尺寸、重叠及多种分块策略(文本、Markdown、YAML、语义),用于LLM上下文或RAG数据预处理。
需要将长文本分割为适合LLM上下文的片段
为向量数据库准备RAG输入数据
使用特定分块器类型处理结构化文档
npx skills add xberg-io/xberg --skill chunking -g -y
提供文档关键词提取(YAKE/RAKE)、语言检测和嵌入生成能力,支持CLI配置与代码集成,用于RAG和搜索的数据预处理。
从文档中提取关键词
检测文档语言
生成文本嵌入向量
npx skills add xberg-io/xberg --skill extracting-keywords -g -y
用于从PDF、电子表格或图像中提取结构化表格数据。支持布局感知检测、多种表模型选择及Markdown/JSON输出格式,适用于财务报表、发票等场景的表格解析。
从PDF文档中提取表格
处理电子表格文件
从图像中识别并提取表格
npx skills add xberg-io/xberg --skill extracting-tables -g -y
提供基于Xberg CLI的OCR文本提取技能,支持扫描PDF及图像。涵盖强制OCR、多后端(Tesseract/PaddleOCR/VLM)切换、语言包管理及性能调优,解决无文本层或乱码问题。
从扫描件或图片中提取文本
处理缺失文本层的PDF
修复提取出的乱码内容
npx skills add xberg-io/xberg --skill extracting-with-ocr -g -y
指导选择文档提取输出的格式(如文本、Markdown、JSON等),通过决策树匹配LLM、RAG或人类阅读等下游消费场景,确保CLI参数配置正确以简化后续处理。
需要决定文档提取结果的输出格式
为LLM、RAG索引器或人工审阅选择合适的--format和--content-format组合
npx skills add xberg-io/xberg --skill picking-a-format -g -y
Xberg文档智能库技能,支持从106种格式提取文本、表格、元数据和图片。涵盖Python/Node/Rust等多语言安装、API调用、OCR配置、批量处理及插件开发。
需要从多种文档格式中提取内容
需要执行文档OCR识别
需要配置文档解析选项如分块或语言检测
npx skills add xberg-io/xberg --skill xberg -g -y
用于批量并行提取多个文件内容,支持共享配置、并发控制、单文件覆盖及容错处理。
需要同时处理多个文件的文档提取
执行带有并行度限制的批量数据抽取任务
npx skills add xberg-io/xberg --skill batch-extraction -g -y
提供文本分块功能,支持LLM上下文窗口和RAG摄入。涵盖字符/令牌大小、重叠设置及多种分块器(文本、Markdown、YAML、语义),通过内联提取或独立命令处理文档。
需要将长文本分割为适合LLM上下文的片段
准备数据以进行向量存储检索(RAG)
使用chunk命令对已有文本进行结构化分块
npx skills add xberg-io/xberg --skill chunking -g -y
提供文档关键词提取(YAKE/RAKE)、语言检测和向量嵌入生成能力,支持通过CLI配置算法参数及特征门控,用于RAG和搜索场景的数据预处理。
需要从文档中提取关键词
需要检测文档语言
需要为RAG或搜索生成向量嵌入
npx skills add xberg-io/xberg --skill extracting-keywords -g -y
用于从PDF、表格或图像中提取结构化表格数据。支持布局感知检测、多种表模型选择及Markdown/JSON输出格式,适用于财务报表、发票等场景。
从PDF提取表格数据
解析电子表格结构
从图片识别表格内容
npx skills add xberg-io/xberg --skill extracting-tables -g -y
用于从扫描件、图片或无文本层的PDF中提取文字。支持多种OCR后端(Tesseract、PaddleOCR、VLM等),配置语言包,处理提取失败或乱码场景。
从扫描PDF或图片中提取文本
PDF提取内容为空或乱码需强制OCR
需要配置特定语言识别
npx skills add xberg-io/xberg --skill extracting-with-ocr -g -y
指导选择文档提取输出格式(如文本、Markdown、JSON等)及CLI参数组合,适配LLM、RAG或人类审阅等下游消费场景。
需要决定提取文档的输出格式
配置CLI工具以匹配特定消费者
npx skills add xberg-io/xberg --skill picking-a-format -g -y
Xberg文档提取技能,支持106种格式文本、表格及图片抽取。涵盖Python/Node/Rust等多语言集成、OCR、批量处理及插件开发,提供安装与API调用指南。
需要从PDF或Office等文档中提取文本或元数据
需要对扫描文档或图片执行OCR识别
需要批量处理多个文件进行内容抽取
需要配置OCR、分块或输出格式等提取选项
npx skills add xberg-io/xberg --skill xberg -g -y
批量提取技能,支持对多文件并行处理、共享配置及单文件覆盖,具备错误恢复机制。适用于目录或通配符文档的一次性结构化提取,可控制并发数与输出布局。
需要同时从多个文件中提取内容
执行批量文档解析任务
处理带有不同配置的混合格式文件集合
npx skills add xberg-io/xberg --skill batch-extraction -g -y
将文本分割为适合LLM上下文或RAG检索的块。支持字符/Token分片、多种分块策略(Markdown/YAML/Semantic)及内联与独立命令模式,优化文档处理效率。
需要将长文档切分为小块以适配LLM上下文窗口
为向量数据库准备RAG数据分片
npx skills add xberg-io/xberg --skill chunking -g -y
提供文档关键词提取(YAKE/RAKE)、语言检测及向量嵌入生成能力,支持CLI配置与算法选择,服务于RAG和搜索场景。
从文档中提取关键词
检测文档语言
为RAG或搜索生成向量嵌入
npx skills add xberg-io/xberg --skill extracting-keywords -g -y
从PDF、电子表格或图片中提取结构化表格数据,支持布局感知检测、多种表格模型选择及Markdown/JSON输出格式。
用户需要从非结构化文档(如PDF、发票)中提取表格数据
需要将扫描件中的财务或科学表格转换为结构化JSON或Markdown
npx skills add xberg-io/xberg --skill extracting-tables -g -y
用于从扫描PDF、照片或无文本层的图像中提取文字。支持OCR后端切换(Tesseract/PaddleOCR/VLM)、多语言包管理及性能调优,解决提取为空或乱码问题。
需要从扫描版PDF中提取文本
处理拍摄的照片或截图中的文字
PDF提取结果为空或乱码需强制OCR
npx skills add xberg-io/xberg --skill extracting-with-ocr -g -y
指导根据下游消费者(LLM、RAG、人类等)选择正确的CLI输出格式和内容渲染格式,提供决策树和示例。
需要为提取的文档选择输出格式
配置CLI工具以匹配特定消费场景
npx skills add xberg-io/xberg --skill picking-a-format -g -y
提供Xberg文档智能库的集成指南,支持从106种格式提取文本、表格及元数据。涵盖Python、Node.js等多语言安装、API调用、OCR配置及批量处理,辅助开发者实现文档解析功能。
需要解析PDF或Office文档内容
执行图像OCR识别
批量处理多文件提取
配置文档抽取参数
npx skills add xberg-io/xberg --skill xberg -g -y
提供基于Axum的REST API服务及MCP协议集成,支持文档提取、异步任务处理及缓存管理。涵盖路由定义、中间件配置、错误处理机制及MCP工具/资源接口实现。
需要调用文档提取或格式检测API
通过MCP协议与AI代理交互
查询作业状态或管理缓存
npx skills add xberg-io/xberg --skill api-server-mcp -g -y
提供多格式文档(Office/PDF/归档/结构化文本/邮件)的提取工作流规范,涵盖解析流程、安全预算控制及元数据提取逻辑。
需要解析特定格式文件内容
询问文档提取器的实现细节
npx skills add xberg-io/xberg --skill format-specific-extraction -g -y


