MatteFormer是基于Transformer的图像抠图模型,利用先验Token和PAST块提升效果。提供SOTA性能评估及预训练模型,适用于Composition-1k等数据集。需Python 3.8、PyTorch 1.10.1及CUDA环境,支持从Deep Image Matting数据集准备数据并进行训练推理。
Python
241
26
Apache License 2.0
2周前
ViTMatte是一个基于预训练纯视觉Transformer的图像抠图工具,旨在提升抠图精度。它通过信息融合技术优化Alpha预测,支持Composition-1K等数据集SOTA性能。该仓库提供Python实现、Colab演示及教程,适用于需要高精度前景提取的研究与开发场景。
Python
546
51
MIT License
4天前
hustvl/ViTMatte cover
diffvg是一个用于2D矢量图形的可微光栅化器。它支持圆形、椭圆、矩形、多边形、曲线等图元的梯度计算,适用于基于梯度的图形编辑、图像合成及深度学习应用。该工具通过Python实现,结合PyTorch提供端到端的可微渲染能力。
Python
1,260
207
Apache License 2.0
6天前
BachiLi/diffvg cover
该仓库提供基于Blender的渲染代码,用于生成doc3D数据集风格的文档图像。支持自定义网格、HDR光照和纹理,可批量渲染图像、UV坐标、法线及深度图,适用于文档去扭曲等计算机视觉任务的3D数据合成。
Python
130
28
2周前
这是一个基于DocTr+模型的文档图像几何校正工具。主要用于矫正扭曲的文档图片,支持通过Python脚本运行推理。用户只需放置预训练模型和失真图像,即可生成校正后的结果,适用于文档数字化预处理场景。
Python
44
4
MIT License
2周前
keepfoolisher/My-DocTr-Plus cover
RAFT是用于光流估计的深度学习模型,基于循环全对字段变换。支持在Sintel、KITTI等数据集上训练和评估,提供预训练模型及演示脚本,适用于计算机视觉任务中的运动场计算。
Python
4,079
680
BSD 3-Clause "New" or "Revised" License
2天前
DocTrPP是PaddlePaddle实现的DocTr++模型,用于文档图像矫正(去扭曲)。支持数据准备、模型训练、推理测试及ONNX导出。需安装PaddlePaddle,通过Python脚本运行训练和预测,适用于需要高精度文档图像处理的场景。
Python
57
8
2周前
GreatV/DocTrPP cover
img2threejs将参考图像重建为纯代码生成的程序化Three.js模型。它无需网格文件或下载,通过代码实现高质量、动画就绪且Token高效的重建,直接在浏览器中运行展示3D效果。
Python
10,176
763
Apache License 2.0
1天前
MUE-X是首个自我进化的AI代理,能实时重写自身源代码。它通过6种AST变异策略持续优化代码,自动吸收GitHub仓库,并具备7种自主驱动力。作为独立CLI工具,支持跨平台运行,实现永不间断的自我迭代与进化。
Python
238
34
MIT License
1周前
picosvg是一个Python工具,用于简化SVG文件以辅助字体构建。它将SVG转换为精简格式:仅含一个defs、绝对坐标及完整路径命令,并将裁剪和描边渲染为路径。该库通过命令行或代码调用,依赖Skia处理复杂图形,旨在提升SVG在字体工程中的兼容性与效率。
Python
219
16
Apache License 2.0
3天前
LightMem-Ego是一个面向日常生活的端到端自我中心记忆系统。它支持智能眼镜、网页捕获和在线后端服务,通过流式处理第一人称视觉与音频数据,构建结构化记忆,帮助用户对当前或过往生活场景进行问答交互。
Python
64
9
MIT License
3天前
zjunlp/LightMem-Ego cover
Rogallo 是一款基于终端的 Gemini 协议客户端。支持书签、历史记录、导航及证书管理等功能,兼容 macOS、Linux 和 Windows 系统,旨在提供跨平台的终端浏览体验。
Python
12
0
GNU General Public License v3.0
3天前
davep/rogallo cover
该工具赋予Claude观看视频的能力。通过下载、提取帧并转录音频,将视觉和听觉信息传递给AI进行分析。支持YouTube链接或本地文件,可回答关于视频内容、结构或特定时间点的详细问题,适用于内容分析和故障诊断。
Python
14,459
1,387
MIT License
1天前
沐阳手绘视频是一个Python工具,输入主题即可自动生成手绘风格动画讲解视频。它整合了文案、分镜、AI绘图、自然配音(Fish/ElevenLabs)、字幕及Remotion动效渲染,支持十种视觉风格和多种排版布局,最终输出MP4成片,提供从一句话指令到完整工程的一站式解决方案。
Python
42
12
MIT License
3天前
yokel1121/muyang-handdrawn-video cover
WANDR是一个面向广泛深度研究的基准测试框架,支持结构化、高容量信息的发现、提取与证据合成。项目采用分层架构,包含数据源、适配器、任务包及代理模块,旨在评估模型在复杂信息处理任务中的表现,适用于AI研究场景。
Python
262
30
Apache License 2.0
4天前

Главная - Вики-сайт
Copyright © 2011-2026 iteam. Current version is 2.155.2. UTC+08:00, 2026-08-09 21:06
浙ICP备14020137号-1 $Гость$