Agent Skills
› xberg-io/xberg
xberg-io/xberg
GitHub管理Alef生成的跨语言绑定代码,指导修改alef.toml和Rust源码后通过task alef:generate重新生成及验证,严禁手动编辑生成文件。
Install All Skills
npx skills add xberg-io/xberg --all -g -y
Skills in Collection (40)
管理Alef生成的跨语言绑定代码,指导修改alef.toml和Rust源码后通过task alef:generate重新生成及验证,严禁手动编辑生成文件。
编辑packages/*或binding crate下的文件
运行alef:generate或alef:verify任务
添加trait方法或extractor
检查alef.toml配置
npx skills add xberg-io/xberg --skill alef-generated-bindings -g -y
管理基准测试工作流,涵盖运行、诊断及变更提取基准、质量评分和固定装置。强调使用独立源验证真相完整性,区分基础设施与提取故障,确保A/B测试环境一致性。
需要运行或分析基准测试结果时
调整基准测试配置或修复质量评分问题时
排查提取器或OCR引擎的质量缺陷时
npx skills add xberg-io/xberg --skill benchmark-workflow -g -y
负责文本分块、向量化嵌入生成及RAG管道集成的核心模块。支持多种分块策略与ONNX静态模型,提供配置预设以适配不同场景的语义切分和向量检索需求。
需要实现文档或文本的分块处理逻辑
请求生成文本的向量嵌入表示
配置或优化RAG检索系统的预处理流程
npx skills add xberg-io/xberg --skill chunking-embeddings -g -y
说明Xberg配置加载优先级、文件发现规则及字段合并机制,涵盖CLI与服务端模式。用于添加配置项、调整优先级或排查配置未生效问题。
添加新的配置标志或环境变量
修改配置加载优先级逻辑
调试配置设置未生效的原因
npx skills add xberg-io/xberg --skill config-loading-precedence -g -y
描述 Xberg Rust 工作区结构,涵盖核心库、多语言绑定及排除项。用于导航仓库、确定代码归属或添加新 crate 时参考版本源与分布包配置。
决定代码归属
添加新的 workspace member
导航仓库结构
npx skills add xberg-io/xberg --skill crate-structure -g -y
Xberg文档提取管道的架构说明,涵盖格式检测、路由、提取及后处理流程。用于理解或诊断提取编排、缓存语义、回退策略及并发等核心逻辑,适用于管道级开发与维护。
需要修改或诊断提取管道的核心逻辑
了解多格式文件的提取编排与缓存机制
排查提取器回退或后处理问题
npx skills add xberg-io/xberg --skill extraction-pipeline-patterns -g -y
定义xberg crate的Cargo特性标志策略,处理WASM/Android模拟器下的ORT兼容性、纯Rust类型及Tract推理替代方案,支持多平台构建配置。
添加或调试Cargo特性
分析跨平台编译约束
配置WASM或Android构建环境
npx skills add xberg-io/xberg --skill feature-flag-policy -g -y
提供MIME类型检测、路由及提取器注册的详细指南。涵盖路径与字节检测机制、FORMATS注册表管理、优先级选择逻辑及新增格式的标准流程,用于指导功能实现与问题排查。
添加新的文件扩展名支持
配置或调试文件提取器路由
排查MIME类型识别错误
npx skills add xberg-io/xberg --skill mime-detection-routing -g -y
管理OCR流水线及质量评估,涵盖预处理、多后端执行、缓存策略、页面接受逻辑及结构化转换。指导A/B测试与精度优化,确保不同后端输出的一致性测量与表格几何重建的准确性。
修改OCR后端配置或执行逻辑
进行OCR质量评估或A/B测试
调整预处理参数或缓存策略
修复OCR结果结构或表格识别问题
npx skills add xberg-io/xberg --skill ocr-pipeline-and-quality -g -y
指导 PDF 后端(Native/Pdfium)的选择、配置与使用,涵盖文本提取、渲染及 OCR 回退。明确两引擎能力差异,强调 Pdfium 的依赖加载、线程锁及错误处理规范,确保后端切换时行为一致且可诊断。
PDF 后端配置变更
Pdfium 集成或故障排查
PDF 渲染性能优化
OCR 功能配置
npx skills add xberg-io/xberg --skill pdf-backends -g -y
定义Xberg插件架构,涵盖文档提取、OCR、后处理等类型。指导实现插件特质、注册机制、优先级冲突处理及生命周期管理,支持Rust原生与Alef生成的Python桥接。
需要设计或实现新的插件模块
诊断插件注册失败或优先级冲突问题
开发跨语言(Rust/Python)插件桥接
npx skills add xberg-io/xberg --skill plugin-architecture-patterns -g -y
定义多仓库协作边界,明确各模块所有权及API归属,指导跨库修复的协调与发布顺序。
需要确定跨仓库修复或API的所属仓库
涉及多个独立Git仓库的协同开发与发布
npx skills add xberg-io/xberg --skill polyrepo-boundaries -g -y
在推送或发布前审计仓库状态,协调CI、发布试运行、基准测试及变更日志,确保发布就绪。
准备推送代码前
执行发布流程前
npx skills add xberg-io/xberg --skill release-readiness -g -y
说明xberg版本同步机制,以Cargo.toml为唯一真值源,通过task命令将版本同步至绑定文件、集成包及Helm图表,确保核心与依赖锁步发布。
执行版本升级或设置
同步多语言包版本
检查版本一致性
npx skills add xberg-io/xberg --skill release-versioning -g -y
指导如何获取、使用和管理测试文档语料库,包括拉取固定数据、处理缺失fixture、正确读取方法以及避免git worktree陷阱。
运行Rust测试前准备环境
诊断缺少fixture导致的测试失败
配置A/B测试控制组
发布或验证语料库变更
npx skills add xberg-io/xberg --skill test-corpus -g -y
定义WASM构建约束,包括同步API模式、2MB HTML限制及优化配置。指导添加兼容提取器或调试构建失败。
构建wasm32目标
添加WASM兼容提取器
调试WASM构建或运行时故障
npx skills add xberg-io/xberg --skill wasm-constraints -g -y
指导在Xberg仓库中处理TypeScript/JavaScript包的规范,涵盖使用poly进行Lint/Format、Vitest测试、pnpm工作区依赖管理及napi-rs/wasm构建流程。
需要遵循Xberg特定的TS/JS代码规范和工具链配置
涉及多包工作区的依赖安装或更新
执行基于poly的Lint和Format操作
npx skills add xberg-io/xberg --skill xberg-typescript-toolchain -g -y
用于批量并行提取多个文档内容,支持共享配置、并发控制、单文件覆盖及错误恢复,适用于大规模文档处理场景。
需要一次性从多个文件中提取内容
处理目录或通配符匹配的大量文档
npx skills add xberg-io/xberg --skill batch-extraction -g -y
将提取的文本分块以适应LLM上下文窗口或RAG向量库。支持字符/Token大小、重叠设置及多种分块策略(Markdown/YAML/语义)。提供内联提取和独立命令两种模式。
需要将长文档切分为小块以输入LLM
为RAG系统准备向量存储数据
处理超过上下文窗口的文本内容
npx skills add xberg-io/xberg --skill chunking -g -y
提供文档关键词提取(YAKE/RAKE)、语言检测及向量嵌入生成能力,支持CLI配置与算法参数调整,服务于RAG和搜索场景。
从文档中提取关键词
检测文档语言
生成用于RAG或搜索的向量嵌入
npx skills add xberg-io/xberg --skill extracting-keywords -g -y
用于从PDF、电子表格或图像中提取结构化表格数据,支持布局感知检测与多种模型选择,输出Markdown或JSON格式。
用户需要从非结构化文档(如PDF)中提取表格数据
用户需要解析Excel或CSV文件并转换为结构化格式
npx skills add xberg-io/xberg --skill extracting-tables -g -y
用于从扫描PDF、照片或图像中提取文本的OCR技能。支持自动检测、强制OCR及多种后端(Tesseract/PaddleOCR/VLM),提供语言包配置与性能调优,解决无文本层或乱码问题。
从扫描版PDF提取文字
处理带文字的图片文件
修复提取为空或乱码的文档
npx skills add xberg-io/xberg --skill extracting-with-ocr -g -y
指导为提取文档选择最佳输出格式,映射下游消费者(LLM、解析器、归档)到正确的CLI参数组合,涵盖决策树与示例。
需要选择文档输出格式时
配置LLM或RAG管道输入格式时
npx skills add xberg-io/xberg --skill picking-a-format -g -y
Xberg文档智能库技能,支持从107种格式提取文本、表格、元数据和图片。涵盖Python/Node/Rust等多语言集成、OCR、批量处理及插件开发。
需要解析PDF或Office文档内容
执行扫描文档OCR识别
批量处理多文件提取任务
npx skills add xberg-io/xberg --skill xberg -g -y
用于批量提取多个文件内容,支持共享配置、并行处理、单文件覆盖及错误恢复。适用于一次性处理目录或通配符匹配的大量文档场景。
需要同时从多个文件中提取内容
使用通配符或目录路径进行批量文档处理
npx skills add xberg-io/xberg --skill batch-extraction -g -y
用于将文本分割为适合 LLM 上下文窗口或 RAG 摄入的分块。支持字符/令牌大小、重叠及多种分块策略,提供内联提取和独立命令两种模式。
需要将长文本切分为小块以适配 LLM 输入
准备数据用于向量数据库或 RAG 系统
npx skills add xberg-io/xberg --skill chunking -g -y
提供文档关键词提取(YAKE/RAKE)、语言检测及向量嵌入生成功能,支持RAG与搜索场景。涵盖CLI配置、算法参数调整及特征门控说明。
需要提取文档关键词
检测文档语言
生成用于RAG的向量嵌入
npx skills add xberg-io/xberg --skill extracting-keywords -g -y
用于从PDF、电子表格或图片中提取结构化表格数据,支持布局感知检测、多种重建模型选择及Markdown/JSON输出格式。
需要提取PDF中的表格数据
将图片或电子表格转换为结构化数据
npx skills add xberg-io/xberg --skill extracting-tables -g -y
提供从扫描PDF、照片或无文本层图像中提取文字的能力,支持多种OCR后端、语言包配置及性能调优。
从扫描PDF提取文字
从图片识别文字
npx skills add xberg-io/xberg --skill extracting-with-ocr -g -y
指导选择文档提取输出格式(如JSON、Markdown等),根据消费者类型(LLM、RAG、解析器等)匹配CLI参数,优化下游处理流程。
选择文档提取输出格式
配置CLI格式化参数
npx skills add xberg-io/xberg --skill picking-a-format -g -y
Xberg文档智能库技能,支持107种格式提取文本、表格及元数据。涵盖Python/Node/Rust等多语言集成、OCR配置、批量处理及插件开发,提供安装与快速入门指南。
需要解析PDF或Office文档内容
执行扫描件OCR识别
批量处理文件提取结构化数据
npx skills add xberg-io/xberg --skill xberg -g -y
用于批量并行提取多个文档内容,支持共享配置、并发控制、单文件覆盖及容错处理。适用于需一次性处理大量文件的场景。
需要批量处理多个文件
涉及文档内容提取任务
npx skills add xberg-io/xberg --skill batch-extraction -g -y
用于将文本分割为适合LLM上下文窗口或RAG ingest的块。支持字符/Token大小、重叠、多种分块策略及内联/独立命令模式。
需要将长文本分割为小块以适配LLM上下文窗口
准备数据用于向量数据库检索增强生成(RAG)
npx skills add xberg-io/xberg --skill chunking -g -y
提供文档关键词提取(YAKE/RAKE)、语言检测及向量嵌入生成的技能说明,涵盖CLI配置、算法特性及功能门控机制。
需要提取文档关键词时
需要检测文档语言时
需要生成向量嵌入用于RAG或搜索时
npx skills add xberg-io/xberg --skill extracting-keywords -g -y
从PDF、电子表格或图片中提取结构化表格数据。支持布局感知检测、多种表模型选择及Markdown/JSON输出格式,适用于财务报表、发票等场景。
用户需要从非结构化文档(如PDF)中提取表格数据
需要将扫描件或图片中的表格转换为结构化格式
npx skills add xberg-io/xberg --skill extracting-tables -g -y
用于从扫描PDF、照片或无文本层的图像中提取文字的OCR技能。支持多种后端如Tesseract、PaddleOCR及VLM,提供语言包管理和性能调优,解决提取为空或乱码问题。
需要从扫描件或图片中提取文字
PDF提取结果为空或乱码需强制OCR
npx skills add xberg-io/xberg --skill extracting-with-ocr -g -y
提供文档提取输出格式选择指南,帮助根据消费端(LLM、RAG、解析器等)匹配正确的CLI参数组合。
需要选择文档提取的输出格式
配置LLM或RAG管道的数据格式
npx skills add xberg-io/xberg --skill picking-a-format -g -y
Xberg文档智能提取技能,支持107种格式文本、表格及元数据提取。涵盖Python/Node/Rust等多语言API调用、OCR配置、批量处理及插件开发,辅助开发者集成文档解析功能。
需要提取PDF或Office文档内容
实现多语言环境下的文档OCR处理
进行大批量文件解析任务
npx skills add xberg-io/xberg --skill xberg -g -y
提供基于Axum的REST API服务与MCP协议集成,支持文档提取、异步任务管理及缓存功能。
需要调用文档提取或检测API
查询异步任务状态
通过MCP协议调用工具
npx skills add xberg-io/xberg --skill api-server-mcp -g -y
提供多格式文档(Office、PDF、归档、结构化文本、邮件)的提取工作流,涵盖内容解析、元数据获取及安全预算控制。
需要解析多种文件格式的内容
文档提取流程配置
npx skills add xberg-io/xberg --skill format-specific-extraction -g -y


