Agent Skills › xberg-io/xberg

xberg-io/xberg

GitHub

管理Alef生成的跨语言绑定代码,指导修改alef.toml和Rust源码后通过task alef:generate重新生成及验证,严禁手动编辑生成文件。

40 skills 9,281

Install All Skills

npx skills add xberg-io/xberg --all -g -y
More Options

List skills in collection

npx skills add xberg-io/xberg --list

Skills in Collection (40)

管理Alef生成的跨语言绑定代码,指导修改alef.toml和Rust源码后通过task alef:generate重新生成及验证,严禁手动编辑生成文件。
编辑packages/*或binding crate下的文件 运行alef:generate或alef:verify任务 添加trait方法或extractor 检查alef.toml配置
.ai-rulez/skills/alef-generated-bindings/SKILL.md
npx skills add xberg-io/xberg --skill alef-generated-bindings -g -y
管理基准测试工作流,涵盖运行、诊断及变更提取基准、质量评分和固定装置。强调使用独立源验证真相完整性,区分基础设施与提取故障,确保A/B测试环境一致性。
需要运行或分析基准测试结果时 调整基准测试配置或修复质量评分问题时 排查提取器或OCR引擎的质量缺陷时
.ai-rulez/skills/benchmark-workflow/SKILL.md
npx skills add xberg-io/xberg --skill benchmark-workflow -g -y
负责文本分块、向量化嵌入生成及RAG管道集成的核心模块。支持多种分块策略与ONNX静态模型,提供配置预设以适配不同场景的语义切分和向量检索需求。
需要实现文档或文本的分块处理逻辑 请求生成文本的向量嵌入表示 配置或优化RAG检索系统的预处理流程
.ai-rulez/skills/chunking-embeddings/SKILL.md
npx skills add xberg-io/xberg --skill chunking-embeddings -g -y
说明Xberg配置加载优先级、文件发现规则及字段合并机制,涵盖CLI与服务端模式。用于添加配置项、调整优先级或排查配置未生效问题。
添加新的配置标志或环境变量 修改配置加载优先级逻辑 调试配置设置未生效的原因
.ai-rulez/skills/config-loading-precedence/SKILL.md
npx skills add xberg-io/xberg --skill config-loading-precedence -g -y
描述 Xberg Rust 工作区结构,涵盖核心库、多语言绑定及排除项。用于导航仓库、确定代码归属或添加新 crate 时参考版本源与分布包配置。
决定代码归属 添加新的 workspace member 导航仓库结构
.ai-rulez/skills/crate-structure/SKILL.md
npx skills add xberg-io/xberg --skill crate-structure -g -y
Xberg文档提取管道的架构说明,涵盖格式检测、路由、提取及后处理流程。用于理解或诊断提取编排、缓存语义、回退策略及并发等核心逻辑,适用于管道级开发与维护。
需要修改或诊断提取管道的核心逻辑 了解多格式文件的提取编排与缓存机制 排查提取器回退或后处理问题
.ai-rulez/skills/extraction-pipeline-patterns/SKILL.md
npx skills add xberg-io/xberg --skill extraction-pipeline-patterns -g -y
定义xberg crate的Cargo特性标志策略,处理WASM/Android模拟器下的ORT兼容性、纯Rust类型及Tract推理替代方案,支持多平台构建配置。
添加或调试Cargo特性 分析跨平台编译约束 配置WASM或Android构建环境
.ai-rulez/skills/feature-flag-policy/SKILL.md
npx skills add xberg-io/xberg --skill feature-flag-policy -g -y
提供MIME类型检测、路由及提取器注册的详细指南。涵盖路径与字节检测机制、FORMATS注册表管理、优先级选择逻辑及新增格式的标准流程,用于指导功能实现与问题排查。
添加新的文件扩展名支持 配置或调试文件提取器路由 排查MIME类型识别错误
.ai-rulez/skills/mime-detection-routing/SKILL.md
npx skills add xberg-io/xberg --skill mime-detection-routing -g -y
管理OCR流水线及质量评估,涵盖预处理、多后端执行、缓存策略、页面接受逻辑及结构化转换。指导A/B测试与精度优化,确保不同后端输出的一致性测量与表格几何重建的准确性。
修改OCR后端配置或执行逻辑 进行OCR质量评估或A/B测试 调整预处理参数或缓存策略 修复OCR结果结构或表格识别问题
.ai-rulez/skills/ocr-pipeline-and-quality/SKILL.md
npx skills add xberg-io/xberg --skill ocr-pipeline-and-quality -g -y
指导 PDF 后端(Native/Pdfium)的选择、配置与使用,涵盖文本提取、渲染及 OCR 回退。明确两引擎能力差异,强调 Pdfium 的依赖加载、线程锁及错误处理规范,确保后端切换时行为一致且可诊断。
PDF 后端配置变更 Pdfium 集成或故障排查 PDF 渲染性能优化 OCR 功能配置
.ai-rulez/skills/pdf-backends/SKILL.md
npx skills add xberg-io/xberg --skill pdf-backends -g -y
定义Xberg插件架构,涵盖文档提取、OCR、后处理等类型。指导实现插件特质、注册机制、优先级冲突处理及生命周期管理,支持Rust原生与Alef生成的Python桥接。
需要设计或实现新的插件模块 诊断插件注册失败或优先级冲突问题 开发跨语言(Rust/Python)插件桥接
.ai-rulez/skills/plugin-architecture-patterns/SKILL.md
npx skills add xberg-io/xberg --skill plugin-architecture-patterns -g -y
定义多仓库协作边界,明确各模块所有权及API归属,指导跨库修复的协调与发布顺序。
需要确定跨仓库修复或API的所属仓库 涉及多个独立Git仓库的协同开发与发布
.ai-rulez/skills/polyrepo-boundaries/SKILL.md
npx skills add xberg-io/xberg --skill polyrepo-boundaries -g -y
在推送或发布前审计仓库状态,协调CI、发布试运行、基准测试及变更日志,确保发布就绪。
准备推送代码前 执行发布流程前
.ai-rulez/skills/release-readiness/SKILL.md
npx skills add xberg-io/xberg --skill release-readiness -g -y
说明xberg版本同步机制,以Cargo.toml为唯一真值源,通过task命令将版本同步至绑定文件、集成包及Helm图表,确保核心与依赖锁步发布。
执行版本升级或设置 同步多语言包版本 检查版本一致性
.ai-rulez/skills/release-versioning/SKILL.md
npx skills add xberg-io/xberg --skill release-versioning -g -y
指导如何获取、使用和管理测试文档语料库,包括拉取固定数据、处理缺失fixture、正确读取方法以及避免git worktree陷阱。
运行Rust测试前准备环境 诊断缺少fixture导致的测试失败 配置A/B测试控制组 发布或验证语料库变更
.ai-rulez/skills/test-corpus/SKILL.md
npx skills add xberg-io/xberg --skill test-corpus -g -y
定义WASM构建约束,包括同步API模式、2MB HTML限制及优化配置。指导添加兼容提取器或调试构建失败。
构建wasm32目标 添加WASM兼容提取器 调试WASM构建或运行时故障
.ai-rulez/skills/wasm-constraints/SKILL.md
npx skills add xberg-io/xberg --skill wasm-constraints -g -y
指导在Xberg仓库中处理TypeScript/JavaScript包的规范,涵盖使用poly进行Lint/Format、Vitest测试、pnpm工作区依赖管理及napi-rs/wasm构建流程。
需要遵循Xberg特定的TS/JS代码规范和工具链配置 涉及多包工作区的依赖安装或更新 执行基于poly的Lint和Format操作
.ai-rulez/skills/xberg-typescript-toolchain/SKILL.md
npx skills add xberg-io/xberg --skill xberg-typescript-toolchain -g -y
用于批量并行提取多个文档内容,支持共享配置、并发控制、单文件覆盖及错误恢复,适用于大规模文档处理场景。
需要一次性从多个文件中提取内容 处理目录或通配符匹配的大量文档
plugin/.ai-rulez/skills/batch-extraction/SKILL.md
npx skills add xberg-io/xberg --skill batch-extraction -g -y
将提取的文本分块以适应LLM上下文窗口或RAG向量库。支持字符/Token大小、重叠设置及多种分块策略(Markdown/YAML/语义)。提供内联提取和独立命令两种模式。
需要将长文档切分为小块以输入LLM 为RAG系统准备向量存储数据 处理超过上下文窗口的文本内容
plugin/.ai-rulez/skills/chunking/SKILL.md
npx skills add xberg-io/xberg --skill chunking -g -y
提供文档关键词提取(YAKE/RAKE)、语言检测及向量嵌入生成能力,支持CLI配置与算法参数调整,服务于RAG和搜索场景。
从文档中提取关键词 检测文档语言 生成用于RAG或搜索的向量嵌入
plugin/.ai-rulez/skills/extracting-keywords/SKILL.md
npx skills add xberg-io/xberg --skill extracting-keywords -g -y
用于从PDF、电子表格或图像中提取结构化表格数据,支持布局感知检测与多种模型选择,输出Markdown或JSON格式。
用户需要从非结构化文档(如PDF)中提取表格数据 用户需要解析Excel或CSV文件并转换为结构化格式
plugin/.ai-rulez/skills/extracting-tables/SKILL.md
npx skills add xberg-io/xberg --skill extracting-tables -g -y
用于从扫描PDF、照片或图像中提取文本的OCR技能。支持自动检测、强制OCR及多种后端(Tesseract/PaddleOCR/VLM),提供语言包配置与性能调优,解决无文本层或乱码问题。
从扫描版PDF提取文字 处理带文字的图片文件 修复提取为空或乱码的文档
plugin/.ai-rulez/skills/extracting-with-ocr/SKILL.md
npx skills add xberg-io/xberg --skill extracting-with-ocr -g -y
指导为提取文档选择最佳输出格式,映射下游消费者(LLM、解析器、归档)到正确的CLI参数组合,涵盖决策树与示例。
需要选择文档输出格式时 配置LLM或RAG管道输入格式时
plugin/.ai-rulez/skills/picking-a-format/SKILL.md
npx skills add xberg-io/xberg --skill picking-a-format -g -y
Xberg文档智能库技能,支持从107种格式提取文本、表格、元数据和图片。涵盖Python/Node/Rust等多语言集成、OCR、批量处理及插件开发。
需要解析PDF或Office文档内容 执行扫描文档OCR识别 批量处理多文件提取任务
plugin/.ai-rulez/skills/xberg/SKILL.md
npx skills add xberg-io/xberg --skill xberg -g -y
用于批量提取多个文件内容,支持共享配置、并行处理、单文件覆盖及错误恢复。适用于一次性处理目录或通配符匹配的大量文档场景。
需要同时从多个文件中提取内容 使用通配符或目录路径进行批量文档处理
plugin/.cursor-plugin/skills/batch-extraction/SKILL.md
npx skills add xberg-io/xberg --skill batch-extraction -g -y
用于将文本分割为适合 LLM 上下文窗口或 RAG 摄入的分块。支持字符/令牌大小、重叠及多种分块策略,提供内联提取和独立命令两种模式。
需要将长文本切分为小块以适配 LLM 输入 准备数据用于向量数据库或 RAG 系统
plugin/.cursor-plugin/skills/chunking/SKILL.md
npx skills add xberg-io/xberg --skill chunking -g -y
提供文档关键词提取(YAKE/RAKE)、语言检测及向量嵌入生成功能,支持RAG与搜索场景。涵盖CLI配置、算法参数调整及特征门控说明。
需要提取文档关键词 检测文档语言 生成用于RAG的向量嵌入
plugin/.cursor-plugin/skills/extracting-keywords/SKILL.md
npx skills add xberg-io/xberg --skill extracting-keywords -g -y
用于从PDF、电子表格或图片中提取结构化表格数据,支持布局感知检测、多种重建模型选择及Markdown/JSON输出格式。
需要提取PDF中的表格数据 将图片或电子表格转换为结构化数据
plugin/.cursor-plugin/skills/extracting-tables/SKILL.md
npx skills add xberg-io/xberg --skill extracting-tables -g -y
提供从扫描PDF、照片或无文本层图像中提取文字的能力,支持多种OCR后端、语言包配置及性能调优。
从扫描PDF提取文字 从图片识别文字
plugin/.cursor-plugin/skills/extracting-with-ocr/SKILL.md
npx skills add xberg-io/xberg --skill extracting-with-ocr -g -y
指导选择文档提取输出格式(如JSON、Markdown等),根据消费者类型(LLM、RAG、解析器等)匹配CLI参数,优化下游处理流程。
选择文档提取输出格式 配置CLI格式化参数
plugin/.cursor-plugin/skills/picking-a-format/SKILL.md
npx skills add xberg-io/xberg --skill picking-a-format -g -y
Xberg文档智能库技能,支持107种格式提取文本、表格及元数据。涵盖Python/Node/Rust等多语言集成、OCR配置、批量处理及插件开发,提供安装与快速入门指南。
需要解析PDF或Office文档内容 执行扫描件OCR识别 批量处理文件提取结构化数据
plugin/.cursor-plugin/skills/xberg/SKILL.md
npx skills add xberg-io/xberg --skill xberg -g -y
用于批量并行提取多个文档内容,支持共享配置、并发控制、单文件覆盖及容错处理。适用于需一次性处理大量文件的场景。
需要批量处理多个文件 涉及文档内容提取任务
plugin/skills/batch-extraction/SKILL.md
npx skills add xberg-io/xberg --skill batch-extraction -g -y
用于将文本分割为适合LLM上下文窗口或RAG ingest的块。支持字符/Token大小、重叠、多种分块策略及内联/独立命令模式。
需要将长文本分割为小块以适配LLM上下文窗口 准备数据用于向量数据库检索增强生成(RAG)
plugin/skills/chunking/SKILL.md
npx skills add xberg-io/xberg --skill chunking -g -y
提供文档关键词提取(YAKE/RAKE)、语言检测及向量嵌入生成的技能说明,涵盖CLI配置、算法特性及功能门控机制。
需要提取文档关键词时 需要检测文档语言时 需要生成向量嵌入用于RAG或搜索时
plugin/skills/extracting-keywords/SKILL.md
npx skills add xberg-io/xberg --skill extracting-keywords -g -y
从PDF、电子表格或图片中提取结构化表格数据。支持布局感知检测、多种表模型选择及Markdown/JSON输出格式,适用于财务报表、发票等场景。
用户需要从非结构化文档(如PDF)中提取表格数据 需要将扫描件或图片中的表格转换为结构化格式
plugin/skills/extracting-tables/SKILL.md
npx skills add xberg-io/xberg --skill extracting-tables -g -y
用于从扫描PDF、照片或无文本层的图像中提取文字的OCR技能。支持多种后端如Tesseract、PaddleOCR及VLM,提供语言包管理和性能调优,解决提取为空或乱码问题。
需要从扫描件或图片中提取文字 PDF提取结果为空或乱码需强制OCR
plugin/skills/extracting-with-ocr/SKILL.md
npx skills add xberg-io/xberg --skill extracting-with-ocr -g -y
提供文档提取输出格式选择指南,帮助根据消费端(LLM、RAG、解析器等)匹配正确的CLI参数组合。
需要选择文档提取的输出格式 配置LLM或RAG管道的数据格式
plugin/skills/picking-a-format/SKILL.md
npx skills add xberg-io/xberg --skill picking-a-format -g -y
Xberg文档智能提取技能,支持107种格式文本、表格及元数据提取。涵盖Python/Node/Rust等多语言API调用、OCR配置、批量处理及插件开发,辅助开发者集成文档解析功能。
需要提取PDF或Office文档内容 实现多语言环境下的文档OCR处理 进行大批量文件解析任务
plugin/skills/xberg/SKILL.md
npx skills add xberg-io/xberg --skill xberg -g -y
提供基于Axum的REST API服务与MCP协议集成,支持文档提取、异步任务管理及缓存功能。
需要调用文档提取或检测API 查询异步任务状态 通过MCP协议调用工具
.ai-rulez/skills/api-server-mcp/SKILL.md
npx skills add xberg-io/xberg --skill api-server-mcp -g -y
提供多格式文档(Office、PDF、归档、结构化文本、邮件)的提取工作流,涵盖内容解析、元数据获取及安全预算控制。
需要解析多种文件格式的内容 文档提取流程配置
.ai-rulez/skills/format-specific-extraction/SKILL.md
npx skills add xberg-io/xberg --skill format-specific-extraction -g -y

inicio - Wiki
Copyright © 2011-2026 iteam. Current version is 2.155.2. UTC+08:00, 2026-09-11 01:17
浙ICP备14020137号-1 $mapa de visitantes$