Mage是微软推出的轻量级多模态模型系列,固定4B参数量。旨在降低计算门槛,支持视觉理解与生成,适用于受控实验、后训练研究及垂直领域应用,强调高效性与研究友好性。
LinearSR是ICLR 2026论文官方代码,利用线性注意力机制实现稳定高效的图像超分辨率。它能在保持线性时间复杂度的同时恢复细节,解决传统注意力二次方计算瓶颈。提供预训练模型及推理脚本,适用于需要高性能图像放大的场景。
Happy Figure Skill 是 Happy Figure 的 Agent 技能,用于将科研内容编译为结构化绘图提示词。它不直接生成图片,而是让 AI Agent 根据领域、图类型和模型特性,生成适配 Nano Banana、Qwen Image、GPT Image 等模型的高质量 Prompt,实现科研插图的精准控制与复用。
基于Backtrader的算法交易回测框架,支持股票、加密货币和外汇市场。提供20多种策略、YAML配置驱动工作流及CLI工具。内置MCP服务器实现与LLM集成,便于AI辅助分析。适用于Python开发者进行量化策略测试与优化。
这是一个基于Python的OpenCV入门教程仓库,旨在3小时内教授计算机视觉基础。内容涵盖图像读取、轮廓检测、颜色识别及人脸检测等核心概念,并包含虚拟画家、文档扫描仪和车牌检测等实用项目示例,适合初学者快速上手。
fast-plate-ocr是一个轻量级、高速的车牌OCR模型库,基于Python和Keras 3构建。它支持从训练到推理的全流程,专为车牌文本识别设计,通常配合目标检测器使用以处理裁剪后的车牌图像。
VODER是一款本地离线、免费的专业语音处理工具,集成8种模式(如TTS、变声、音乐生成等),支持多角色对话脚本编写与声音克隆。无需订阅,可在无GPU环境下运行,提供从转录到重合成的完整音频工作流。
AI-Content-Studio是一个开源的YouTube自动化内容生成工具。它利用AI自动完成从选题调研、脚本撰写、语音合成、视频制作到封面生成及SEO优化的全流程,最终自动发布视频,实现无人值守的YouTube频道增长。
Video Depth Anything 是 CVPR 2025 Highlight 项目,基于 Depth Anything V2,专为超长视频提供高质量、高一致性的深度估计。相比扩散模型,它具有推理更快、参数更少及精度更高的优势,支持相对深度与度量深度,并具备流式处理实验功能。
Seedance 2.0 Skill OS 是一个面向 Seedance 2.0 的全流程 AI 电影制作生产管线。它作为智能代理,能像导演一样阅读场景并生成提示词,支持文本、图像、视频及参考视频的四方模态输入,具备原生音频支持和多语言读取能力,旨在简化 AI 视频创作工作流。
基于PyTorch的文档图像去弯曲工具,实现DocUNet算法。通过预测逆向量场提升推理速度,支持UNet、Deeplabv3+等模型及MS-SSIM损失函数,能在CPU上实现实时处理。适用于修复扫描文档的卷曲变形问题。
UPOCR是ICML 2024论文的统一像素级OCR接口官方实现。它是一个通用模型,通过统一范式、架构和训练策略,在文本移除、检测和分割等多种像素级OCR任务中表现优异。用户需配置Python环境并下载数据集与权重进行推理。
该工具用于移除写作中20多种典型的AI生成痕迹(如陈词滥调、虚假洞察等),同时保留作者个人风格。它不仅能检测并消除这些模式,还能在不清除个性声音的前提下提升文本的自然度和专业性,适用于各类文本编辑场景。
该项目在ESP32-S3微控制器上运行拥有2890万参数的语言模型,实现完全离线文本生成。利用Flash存储和Per-Layer Embeddings技术突破内存限制,无需服务器支持,适合资源受限的边缘计算场景。
Netmon是一个自托管的轻量级网络监控工具,使用Python编写。它定期执行网速测试和局域网设备扫描,并将结果存储于SQLite。每4小时通过Telegram或Discord发送包含趋势图和AI讽刺评论的详细报告,全程本地运行,保护隐私。


