PromptXRay是Python编写的代理工具,用于分析OpenAI兼容API的Prompt缓存行为。通过拦截流量识别重复请求,提供TUI界面辅助优化提示词以提升缓存命中率、节省Token。支持本地运行,仅读且保护隐私,适用于测试环境。
该Python工具利用Gemini API,将中文观点转化为“纸上钢笔线稿+彩铅”风格的知识讲解动画。通过三闸门工作流生成视频素材,支持自定义画幅、配色及音效,适用于短视频内容创作。
Hyperresearch是一个基于Python的AI代理驱动研究知识库工具。它利用Claude Code执行深度研究,通过自适应流水线收集、搜索并综合网络信息,生成经过验证且带有完整来源引用的持久化报告,构建可搜索的研究档案。
Vox Director 是一个自动化视频生成工具,能将单一主题转化为 Vox 风格的纸拼贴解说/广告视频。它通过 Atlas Cloud API 和本地 ffmpeg 自动完成脚本、关键帧、配音及字幕等全流程,作为 Agent 技能供编程助手调用,输入主题即可输出 MP4 视频。
Qwen-Image-Layered是一款将图像分解为多个RGBA层的模型,实现固有可编辑性。各层可独立操作,支持缩放、位移和重着色等保真操作,便于高保真且一致的图像编辑。
MatteFormer是基于Transformer的图像抠图模型,利用先验Token和PAST块提升效果。提供SOTA性能评估及预训练模型,适用于Composition-1k等数据集。需Python 3.8、PyTorch 1.10.1及CUDA环境,支持从Deep Image Matting数据集准备数据并进行训练推理。
ViTMatte是一个基于预训练纯视觉Transformer的图像抠图工具,旨在提升抠图精度。它通过信息融合技术优化Alpha预测,支持Composition-1K等数据集SOTA性能。该仓库提供Python实现、Colab演示及教程,适用于需要高精度前景提取的研究与开发场景。
diffvg是一个用于2D矢量图形的可微光栅化器。它支持圆形、椭圆、矩形、多边形、曲线等图元的梯度计算,适用于基于梯度的图形编辑、图像合成及深度学习应用。该工具通过Python实现,结合PyTorch提供端到端的可微渲染能力。
该仓库提供基于Blender的渲染代码,用于生成doc3D数据集风格的文档图像。支持自定义网格、HDR光照和纹理,可批量渲染图像、UV坐标、法线及深度图,适用于文档去扭曲等计算机视觉任务的3D数据合成。
这是一个基于DocTr+模型的文档图像几何校正工具。主要用于矫正扭曲的文档图片,支持通过Python脚本运行推理。用户只需放置预训练模型和失真图像,即可生成校正后的结果,适用于文档数字化预处理场景。
RAFT是用于光流估计的深度学习模型,基于循环全对字段变换。支持在Sintel、KITTI等数据集上训练和评估,提供预训练模型及演示脚本,适用于计算机视觉任务中的运动场计算。
DocTrPP是PaddlePaddle实现的DocTr++模型,用于文档图像矫正(去扭曲)。支持数据准备、模型训练、推理测试及ONNX导出。需安装PaddlePaddle,通过Python脚本运行训练和预测,适用于需要高精度文档图像处理的场景。
img2threejs将参考图像重建为纯代码生成的程序化Three.js模型。它无需网格文件或下载,通过代码实现高质量、动画就绪且Token高效的重建,直接在浏览器中运行展示3D效果。
MUE-X是首个自我进化的AI代理,能实时重写自身源代码。它通过6种AST变异策略持续优化代码,自动吸收GitHub仓库,并具备7种自主驱动力。作为独立CLI工具,支持跨平台运行,实现永不间断的自我迭代与进化。
picosvg是一个Python工具,用于简化SVG文件以辅助字体构建。它将SVG转换为精简格式:仅含一个defs、绝对坐标及完整路径命令,并将裁剪和描边渲染为路径。该库通过命令行或代码调用,依赖Skia处理复杂图形,旨在提升SVG在字体工程中的兼容性与效率。


