mu-pdf-converter是一个100%本地运行的开源PDF转换工具,支持将PDF高保真转换为PPT、Word、Excel及图片。具备四层解析、三引擎表格提取、自动翻译和水印去除功能,适用于财报、合同、发票等场景的批量处理与数据提取。
Learn UI Name是namethatui.com的中英双语复刻版,提供62个可交互UI标本及44种视觉风格图鉴。支持搜索、测验和一键复制Prompt,旨在帮助用户精准命名UI元素并高效指挥AI编程代理,具备PWA离线访问能力。
LingBot-World 2.0是一个基于Python的先进世界建模项目,支持无限时长、高速响应的交互式视频生成。它集成了智能体框架以规划角色行为和环境事件,提供多样化动作与文本驱动事件,适用于构建动态逼真的虚拟交互世界。
Hermespace是Hermes Agent的持久化世界模型,提供追加式存档记录所有会话与信念。它作为Agent的内部记忆层,支持跨会话自我进化与环境建模,非独立运行时,旨在构建永不衰减的Agent知识库。
Model-trader是一个Python框架,将交易员的录音内容转化为可执行的筛选器和模拟交易机器人。它提取策略逻辑作为通过/失败检查点,在Hyperliquid上进行纸面交易,并可选地集成LLM代理进行哲学审查。旨在把主观判断结构化为自动化代码。
NIUBI Skill是一个AI辅助商业纠偏工具,帮助开发者在投入前验证项目变现潜力。它通过判断当前工作是否接近收入,推荐最可行的获利路径和七天可验证行动,强调先拿到真实商业反馈再继续开发。
PromptXRay是Python编写的代理工具,用于分析OpenAI兼容API的Prompt缓存行为。通过拦截流量识别重复请求,提供TUI界面辅助优化提示词以提升缓存命中率、节省Token。支持本地运行,仅读且保护隐私,适用于测试环境。
该Python工具利用Gemini API,将中文观点转化为“纸上钢笔线稿+彩铅”风格的知识讲解动画。通过三闸门工作流生成视频素材,支持自定义画幅、配色及音效,适用于短视频内容创作。
Hyperresearch是一个基于Python的AI代理驱动研究知识库工具。它利用Claude Code执行深度研究,通过自适应流水线收集、搜索并综合网络信息,生成经过验证且带有完整来源引用的持久化报告,构建可搜索的研究档案。
Vox Director 是一个自动化视频生成工具,能将单一主题转化为 Vox 风格的纸拼贴解说/广告视频。它通过 Atlas Cloud API 和本地 ffmpeg 自动完成脚本、关键帧、配音及字幕等全流程,作为 Agent 技能供编程助手调用,输入主题即可输出 MP4 视频。
Qwen-Image-Layered是一款将图像分解为多个RGBA层的模型,实现固有可编辑性。各层可独立操作,支持缩放、位移和重着色等保真操作,便于高保真且一致的图像编辑。
MatteFormer是基于Transformer的图像抠图模型,利用先验Token和PAST块提升效果。提供SOTA性能评估及预训练模型,适用于Composition-1k等数据集。需Python 3.8、PyTorch 1.10.1及CUDA环境,支持从Deep Image Matting数据集准备数据并进行训练推理。
ViTMatte是一个基于预训练纯视觉Transformer的图像抠图工具,旨在提升抠图精度。它通过信息融合技术优化Alpha预测,支持Composition-1K等数据集SOTA性能。该仓库提供Python实现、Colab演示及教程,适用于需要高精度前景提取的研究与开发场景。
diffvg是一个用于2D矢量图形的可微光栅化器。它支持圆形、椭圆、矩形、多边形、曲线等图元的梯度计算,适用于基于梯度的图形编辑、图像合成及深度学习应用。该工具通过Python实现,结合PyTorch提供端到端的可微渲染能力。
该仓库提供基于Blender的渲染代码,用于生成doc3D数据集风格的文档图像。支持自定义网格、HDR光照和纹理,可批量渲染图像、UV坐标、法线及深度图,适用于文档去扭曲等计算机视觉任务的3D数据合成。


