Agent Skills
› Orchestra-Research/AI-Research-SKILLs
Orchestra-Research/AI-Research-SKILLs
GitHub基于LitGPT实现和训练大型语言模型,支持Llama、Phi等20+预训练架构。提供单文件代码以利于理解,并指导使用LoRA/QLoRA进行高效生产级微调及自定义数据集配置。
Install All Skills
npx skills add Orchestra-Research/AI-Research-SKILLs --all -g -y
Skills in Collection (96)
Showing top 50 of 96 by quality score. Use the install list command or open individual skills for the rest.
基于LitGPT实现和训练大型语言模型,支持Llama、Phi等20+预训练架构。提供单文件代码以利于理解,并指导使用LoRA/QLoRA进行高效生产级微调及自定义数据集配置。
需要实现或加载预训练LLM模型
执行大模型全量微调或LoRA/QLoRA参数高效微调
准备指令跟随格式的训练数据集
npx skills add Orchestra-Research/AI-Research-SKILLs --skill implementing-llms-litgpt -g -y
Dependencies:
litgpt
torch
transformers
提供Mamba选择性状态空间模型的安装、配置及推理指南,涵盖Mamba-1/2架构差异、HuggingFace模型加载及文本生成工作流,适用于高效序列建模任务。
需要部署或测试Mamba架构模型
询问Mamba与Transformer的性能对比
查找Mamba-1和Mamba-2的配置参数
npx skills add Orchestra-Research/AI-Research-SKILLs --skill mamba-architecture -g -y
Dependencies:
mamba-ssm
torch
transformers
causal-conv1d
RWKV架构技能,结合Transformer训练与RNN推理效率。提供安装、GPT/RNN模式使用、流式文本生成、长上下文处理及微调工作流的代码示例,支持无限上下文和常数内存占用。
需要高效推理的LLM场景
长文本或无限上下文处理
RWKV模型微调
对比Transformer与RNN性能
npx skills add Orchestra-Research/AI-Research-SKILLs --skill rwkv-architecture -g -y
Dependencies:
rwkv
torch
transformers
基于 PyTorch 的原生分布式 LLM 预训练工具,支持 FSDP2、TP、PP、CP 等 4D 并行策略。适用于在大规模 GPU 集群上对 Llama 3.1、DeepSeek V3 等模型进行预训练,提供配置、启动及监控流程。
需要在大模型上进行分布式预训练
配置多卡或多节点训练任务
使用 TorchTitan 框架训练 LLM
npx skills add Orchestra-Research/AI-Research-SKILLs --skill distributed-llm-pretraining-torchtitan -g -y
Dependencies:
torch>=2.6.0
torchtitan>=0.2.0
torchao>=0.5.0
提供高性能NLP分词工具,支持BPE等算法及自定义训练。适用于快速文本处理、大语料库分词及生产环境集成,解决纯Python实现性能瓶颈问题。
需要高性能文本分词
从 scratch 训练自定义 tokenizer
构建大规模 NLP 数据预处理流水线
npx skills add Orchestra-Research/AI-Research-SKILLs --skill huggingface-tokenizers -g -y
SentencePiece是一款语言无关的无监督文本分词工具,支持BPE和Unigram算法。适用于多语言、CJK语言及需可重复性分词的场景,具有轻量、快速、无需预处理等特点。
需要构建多语言模型
处理中文/日文/韩文等CJK语言
需要可重复的分词结果
对原始文本进行训练而不做预分词
npx skills add Orchestra-Research/AI-Research-SKILLs --skill sentencepiece -g -y
Dependencies:
sentencepiece
transformers
提供LLaMA-Factory大模型微调专家指导,涵盖WebUI无代码操作、多模型支持及QLoRA等技术。适用于使用该工具进行开发、功能查询、方案实现、代码调试及最佳实践学习等场景。
使用llama-factory进行开发
询问llama-factory特性或API
实现llama-factory解决方案
调试llama-factory代码
学习llama-factory最佳实践
npx skills add Orchestra-Research/AI-Research-SKILLs --skill llama-factory -g -y
提供大语言模型参数高效微调能力,支持LoRA、QLoRA等25+方法。适用于显存受限环境下训练7B-70B模型,通过仅更新少量参数实现快速迭代与多适配器部署。
需要在大模型上进行微调但GPU显存不足
希望以极低参数量代价保留模型性能
需要基于同一基座模型训练多个特定任务适配器
npx skills add Orchestra-Research/AI-Research-SKILLs --skill peft-fine-tuning -g -y
Dependencies:
peft>=0.13.0
transformers>=4.45.0
torch>=2.0.0
bitsandbytes>=0.43.0
指导使用nnsight库进行神经网络内部机制解释,支持本地小模型与NDIF远程运行70B+大模型,实现激活干预、追踪及数据共享。
需要分析大型语言模型内部结构
在无GPU环境下运行模型解释实验
对PyTorch模型进行激活干预
npx skills add Orchestra-Research/AI-Research-SKILLs --skill nnsight-remote-interpretability -g -y
Dependencies:
nnsight>=0.5.0
torch>=2.0.0
提供使用 pyvene 对 PyTorch 模型执行因果干预的指导,涵盖因果追踪、激活补丁和互换干预训练等实验场景。
进行因果追踪实验
运行激活补丁分析
实施互换干预训练
npx skills add Orchestra-Research/AI-Research-SKILLs --skill pyvene-interventions -g -y
Dependencies:
pyvene>=0.1.8
torch>=2.0.0
transformers>=4.30.0
提供使用SAELens训练和分析稀疏自编码器的指导,将神经网络激活分解为可解释特征。适用于发现模型中的可解释概念、分析超位现象及研究单语义表示等机制可解释性任务。
需要分解神经网络的激活以获取可解释特征
分析模型的超位现象或单语义表示
研究语言模型内部的概念学习
npx skills add Orchestra-Research/AI-Research-SKILLs --skill sparse-autoencoder-training -g -y
Dependencies:
sae-lens>=6.0.0
transformer-lens>=2.0.0
torch>=2.0.0
提供TransformerLens库使用指南,支持通过HookPoints和激活缓存检查、操纵Transformer内部结构。适用于逆向工程模型算法、研究注意力模式及进行激活修补实验等机制可解释性研究任务。
逆向工程训练中学到的算法
执行激活修补或因果追踪实验
研究注意力模式和信息流
分析神经网络电路
npx skills add Orchestra-Research/AI-Research-SKILLs --skill transformer-lens-interpretability -g -y
Dependencies:
transformer-lens>=2.0.0
torch>=2.0.0
NVIDIA NeMo Curator 是 GPU 加速的 LLM 训练数据清洗工具,支持文本/图像等多模态数据的模糊去重、质量过滤、PII 脱敏及 NSFW 检测,提供高效的数据策展流水线。
LLM 训练数据集准备
大规模数据去重
多模态数据清洗
npx skills add Orchestra-Research/AI-Research-SKILLs --skill nemo-curator -g -y
Dependencies:
nemo-curator
cudf
dask
rapids
Ray Data是面向ML/AI的大规模分布式数据处理库,支持流式执行、GPU加速及多模态数据加载。适用于TB级数据预处理、批量推理和分布式ETL,无缝集成PyTorch/TensorFlow等框架,实现从单机到集群的弹性扩展。
处理超大规模数据集用于模型训练
构建分布式数据预处理流水线
进行批量推理前的数据加载与转换
需要跨节点并行处理多模态数据
npx skills add Orchestra-Research/AI-Research-SKILLs --skill ray-data -g -y
Dependencies:
ray[data]
pyarrow
pandas
提供基于TRL库的GRPO强化学习微调专家指导,涵盖算法原理、奖励函数设计及数据集准备,用于提升模型推理能力与格式约束。
需要进行大模型强化学习微调
需要设计自定义奖励函数
需要优化模型推理或输出格式
npx skills add Orchestra-Research/AI-Research-SKILLs --skill grpo-rl-training -g -y
Dependencies:
transformers>=4.47.0
trl>=0.14.0
datasets>=3.2.0
peft>=0.14.0
torch
提供企业级强化学习训练指导,针对TB+ MoE模型、FP8/INT4量化及推理对齐优化。
MoE模型训练
FP8/INT4量化训练
强化学习配置
npx skills add Orchestra-Research/AI-Research-SKILLs --skill miles-rl-training -g -y
Dependencies:
sglang-router>=0.2.3
ray
torch>=2.0.0
transformers>=4.40.0
基于Ray和vLLM的高性能RLHF训练框架,支持PPO、GRPO等算法,用于7B-70B+大模型的分布式强化学习微调,提供完整SFT至奖励模型训练工作流。
需要执行大规模语言模型强化学习训练
配置Ray集群进行多GPU分布式RLHF任务
运行PPO或DPO等对齐算法流程
npx skills add Orchestra-Research/AI-Research-SKILLs --skill openrlhf-training -g -y
Dependencies:
openrlhf
ray
vllm
torch
transformers
deepspeed
提供SimPO算法的LLM偏好对齐训练指南,涵盖环境配置、模型微调及超参数设置,旨在替代DPO实现更高效、无需参考模型的指令对齐。
进行大语言模型偏好优化或指令对齐
需要比DPO更简单的训练流程
配置SimPO训练脚本和超参数
npx skills add Orchestra-Research/AI-Research-SKILLs --skill simpo-training -g -y
指导基于slime框架进行LLM强化学习后训练,集成Megatron-LM与SGLang,适用于GLM等模型训练、自定义数据生成及大规模RL扩展场景。
需要LLM强化学习后训练指导
使用slime/Megatron-LM/SGLang架构
训练GLM或兼容模型
npx skills add Orchestra-Research/AI-Research-SKILLs --skill slime-rl-training -g -y
Dependencies:
sglang-router>=0.2.3
ray
torch>=2.0.0
transformers>=4.40.0
提供基于PyTorch的torchforge库进行强化学习训练的指南,涵盖算法实现、分布式训练及推理集成,适用于RL研究与实验。
使用torchforge进行强化学习训练
配置GRPO等RL算法实验
设置分布式RL训练环境
npx skills add Orchestra-Research/AI-Research-SKILLs --skill torchforge-rl-training -g -y
Dependencies:
torch>=2.9.0
torchtitan>=0.2.0
vllm
monarch
基于TRL库进行大语言模型强化学习微调,涵盖SFT、DPO及PPO流程,用于指令调优与偏好对齐。
需要对LLM进行RLHF训练
需要执行偏好对齐或奖励建模
npx skills add Orchestra-Research/AI-Research-SKILLs --skill fine-tuning-with-trl -g -y
指导使用verl库进行LLM强化学习训练,支持PPO、GRPO等算法及大规模分布式部署,适用于RLHF、数学推理模型微调等场景。
需要在大模型上实施强化学习(如RLHF、GRPO)
配置大规模分布式RL训练环境
npx skills add Orchestra-Research/AI-Research-SKILLs --skill verl-rl-training -g -y
Dependencies:
verl>=0.3.0
torch>=2.0.0
ray>=2.41.0
vllm>=0.8.2
transformers>=4.40.0
基于Anthropic的Constitutional AI方法,通过自我批判和AI反馈训练模型无害性。包含监督学习与RLAIF两阶段工作流,用于安全对齐及减少有害输出,无需人工标注。
需要训练或微调大语言模型的安全性/无害性
希望使用AI反馈替代人工标注进行RLHF
实施Constitutional AI框架进行模型对齐
npx skills add Orchestra-Research/AI-Research-SKILLs --skill constitutional-ai -g -y
Dependencies:
transformers
torch
trl
LlamaGuard AI内容审核技能,用于过滤LLM输入输出中的暴力、仇恨等不安全内容。提供基础用法及vLLM部署工作流,支持S1-S6六大安全类别分类,保障应用合规与安全。
用户询问敏感或非法话题
需要审查AI生成回复的安全性
集成内容过滤中间件
npx skills add Orchestra-Research/AI-Research-SKILLs --skill llamaguard -g -y
Dependencies:
transformers
torch
vllm
NVIDIA NeMo Guardrails 是用于 LLM 应用的运行时安全框架,支持通过 Colang DSL 配置护栏,实现越狱检测、输入输出验证、事实核查、幻觉检测及 PII 过滤等功能。
需要为 LLM 应用添加运行时安全防护
检测或防止提示词注入和越狱攻击
验证 LLM 输出的事实准确性或毒性
npx skills add Orchestra-Research/AI-Research-SKILLs --skill nemo-guardrails -g -y
Dependencies:
nemoguardrails
Meta Prompt Guard 模型,用于检测 LLM 应用中的提示注入和越狱攻击。提供用户输入过滤及第三方数据(如 RAG)清洗功能,具有高准确率与低延迟,保障大模型交互安全。
需要检测提示词注入或越狱尝试
LLM 应用安全防护需求
RAG 系统内容清洗
npx skills add Orchestra-Research/AI-Research-SKILLs --skill prompt-guard -g -y
Dependencies:
transformers
torch
HuggingFace Accelerate 库,用于简化 PyTorch 分布式训练。提供统一 API 支持多 GPU/节点、自动设备放置及混合精度,兼容 DeepSpeed/FSDP 等后端,降低分布式开发门槛。
需要将单卡 PyTorch 代码迁移至多卡或多节点环境
配置或启用模型训练的混合精度(FP16/BF16)
使用 HuggingFace 生态进行大规模模型分布式训练
npx skills add Orchestra-Research/AI-Research-SKILLs --skill huggingface-accelerate -g -y
Dependencies:
accelerate
torch
transformers
提供 DeepSpeed 分布式训练专家指导,涵盖 ZeRO 优化、并行策略及 DeepNVMe 高性能 I/O 操作。适用于配置环境、创建句柄、调试代码及学习最佳实践等场景。
使用 DeepSpeed 进行模型训练
询问 DeepSpeed 特性或 API
实现 DeepSpeed 解决方案
调试 DeepSpeed 相关代码
npx skills add Orchestra-Research/AI-Research-SKILLs --skill deepspeed -g -y
Dependencies:
deepspeed
torch
transformers
accelerate
提供基于NVIDIA Megatron-Core的大规模LLM训练技能,支持2B至462B参数模型。涵盖3D并行策略配置、MoE训练及分布式启动监控,旨在最大化H100 GPU效率。
训练超过1B参数的LLM
需要Tensor/Pipeline/Expert等高级并行策略
追求H100上最高GPU利用率
npx skills add Orchestra-Research/AI-Research-SKILLs --skill training-llms-megatron -g -y
指导 Agent 在 PyTorch 训练脚本中正确集成 FSDP2,处理模型分片、混合精度及分布式检查点,解决单卡显存不足问题。
模型超出单 GPU 显存限制
需要 DTensor 参数级分片
配置分布式训练环境
npx skills add Orchestra-Research/AI-Research-SKILLs --skill pytorch-fsdp2 -g -y
Dependencies:
torch
PyTorch Lightning 高层训练框架,通过 Trainer 和 Callbacks 消除样板代码,支持分布式、混合精度及自动日志。用于简化模型训练流程,实现从笔记本到超算的无缝扩展。
需要简化 PyTorch 训练循环
配置分布式或多 GPU 训练
管理模型检查点和日志记录
npx skills add Orchestra-Research/AI-Research-SKILLs --skill pytorch-lightning -g -y
Dependencies:
lightning
torch
transformers
用于分布式机器学习训练编排,支持PyTorch/TensorFlow/HuggingFace从单节点扩展至千级节点集群。内置超参数调优、容错和弹性伸缩能力,适用于大规模模型训练及分布式超参搜索场景。
需要跨多机或多GPU进行大规模模型训练
执行分布式超参数搜索或自动化调优任务
npx skills add Orchestra-Research/AI-Research-SKILLs --skill ray-train -g -y
Dependencies:
ray[train]
torch
transformers
Lambda Labs GPU云使用指南,涵盖GPU实例选择、SSH连接、Lambda Stack配置及多节点集群部署,适用于ML训练与推理场景。
需要启动GPU云服务器
配置ML训练环境
访问GPU实例
npx skills add Orchestra-Research/AI-Research-SKILLs --skill lambda-labs-gpu-cloud -g -y
Dependencies:
lambda-cloud-client>=1.0.0
提供Modal无服务器GPU平台的使用指南,涵盖安装、核心概念及GPU配置。支持ML工作负载运行、模型API部署及批量任务处理,强调按需访问与自动扩缩容能力。
需要无服务器GPU环境进行机器学习训练或推理
部署机器学习模型为REST API
运行需要自动扩展的批量数据处理作业
npx skills add Orchestra-Research/AI-Research-SKILLs --skill modal-serverless-gpu -g -y
Dependencies:
modal>=0.64.0
SkyPilot多云ML工作负载编排技能,支持跨AWS/GCP/Azure等20+提供商自动成本优化、Spot实例自动恢复及分布式训练。提供统一接口避免厂商锁定,适用于GPU资源调度与模型部署。
需要跨多个云平台运行机器学习训练或批量任务
希望通过自动选择最便宜区域和Spot实例来优化GPU成本
需要管理具有自动恢复功能的分布式多节点训练作业
npx skills add Orchestra-Research/AI-Research-SKILLs --skill skypilot-multi-cloud-orchestration -g -y
Dependencies:
skypilot>=0.7.0
AWQ技能用于大语言模型4-bit量化压缩,在有限GPU内存下部署7B-70B模型。提供比GPTQ更快的推理速度和更少的精度损失,支持vLLM和Ampere+ GPU加速,适用于指令微调及多模态模型的快速生产环境部署。
需要在受限GPU内存上部署大型LLM
追求比GPTQ更快的推理速度且需保持高精度
对指令微调或Chat模型进行4-bit量化优化
npx skills add Orchestra-Research/AI-Research-SKILLs --skill awq-quantization -g -y
Dependencies:
autoawq
transformers>=4.45.0
torch>=2.0.0
提供LLM量化指南,支持8-bit/4-bit压缩以节省GPU显存,涵盖INT8、NF4格式及QLoRA微调,适用于显存受限或需加速推理场景。
GPU显存不足
需要加载更大模型
希望提升推理速度
进行QLoRA微调
npx skills add Orchestra-Research/AI-Research-SKILLs --skill quantizing-models-bitsandbytes -g -y
Dependencies:
bitsandbytes
transformers
accelerate
torch
优化Transformer注意力机制,利用Flash Attention实现2-4倍加速和10-20倍内存节省。适用于长序列训练推理、GPU显存不足场景,支持PyTorch原生SDPA及flash-attn库集成。
Transformer模型训练或推理速度慢
处理长序列时遇到GPU显存溢出
需要优化注意力计算性能
npx skills add Orchestra-Research/AI-Research-SKILLs --skill optimizing-attention-flash -g -y
Dependencies:
flash-attn
torch
transformers
提供GGUF格式转换、量化及llama.cpp推理部署指南,支持CPU/Apple Silicon等多平台高效运行。
在消费级硬件或无GPU环境下部署大模型
需要将HuggingFace模型转换为GGUF格式并进行量化
使用llama.cpp进行本地AI推理
npx skills add Orchestra-Research/AI-Research-SKILLs --skill gguf-quantization -g -y
Dependencies:
llama-cpp-python>=0.2.0
GPTQ技能用于大语言模型4-bit后训练量化,实现显存降低4倍且精度损失极小。支持在消费级GPU部署70B+模型,提供3-4倍推理加速,并集成transformers与PEFT以支持QLoRA微调及自定义量化流程。
需要在有限显存的GPU上部署超大参数模型
需要显著减少模型内存占用同时保持高精度
追求比FP16更快的推理速度
需要对自有模型进行4-bit量化处理
npx skills add Orchestra-Research/AI-Research-SKILLs --skill gptq -g -y
Dependencies:
auto-gptq
transformers
optimum
peft
HQQ技能提供无需校准数据的LLM快速量化方案,支持1-8位精度及多种后端,集成vLLM和Transformers,适用于模型压缩与部署。
需要量化LLM至4/3/2/1-bit精度
无校准数据需快速量化
使用vLLM或HuggingFace部署量化模型
对量化模型进行LoRA微调
npx skills add Orchestra-Research/AI-Research-SKILLs --skill hqq-quantization -g -y
Dependencies:
hqq>=0.2.0
torch>=2.0.0
提供PyTorch训练配方,涵盖模型选择、优化器配置、混合精度及调试技巧。适用于LLM、视觉等领域神经网络训练、微调、OOM排查及GPU性能优化。
训练或微调神经网络
调试损失激增或内存溢出(OOM)
选择模型架构
优化GPU吞吐量
npx skills add Orchestra-Research/AI-Research-SKILLs --skill ml-training-recipes -g -y
Dependencies:
torch>=2.0.0
用于评估代码生成模型性能的基准测试工具,支持HumanEval等15+数据集及多语言,通过pass@k指标衡量代码质量与能力。
需要评测代码生成模型的准确性
对比不同代码大模型的性能表现
验证模型在多语言环境下的代码生成能力
npx skills add Orchestra-Research/AI-Research-SKILLs --skill evaluating-code-models -g -y
Dependencies:
bigcode-evaluation-harness
transformers>=4.25.1
accelerate>=0.13.2
datasets>=2.6.1
用于评估LLM在60多个学术基准(如MMLU、HumanEval)上的性能,支持模型对比、训练进度跟踪及学术报告生成。提供标准化评测流程与结果分析。
需要评估大语言模型在多领域基准测试中的表现
对比不同模型或检查点的性能差异
生成符合行业标准的学术评测报告
npx skills add Orchestra-Research/AI-Research-SKILLs --skill evaluating-llms-harness -g -y
Dependencies:
lm-eval
transformers
vllm
在CPU、Apple Silicon或非NVIDIA硬件上进行LLM推理,支持边缘部署与GGUF量化,提供低依赖的C/C++实现及OpenAI兼容API。
需要在无CUDA环境的CPU或AMD/Intel GPU上运行大模型
在Apple Silicon设备上优化本地LLM推理性能
需要轻量级、无需Docker的LLM边缘部署方案
npx skills add Orchestra-Research/AI-Research-SKILLs --skill llama-cpp -g -y
Dependencies:
llama-cpp-python
SGLang是高性能LLM/VLM推理框架,支持RadixAttention前缀缓存、结构化输出及Agent工作流。适用于需要JSON/正则约束解码、多轮对话共享上下文及提升推理速度的场景。
需要结构化JSON或正则输出
构建具有重复前缀的Agent工作流
多轮对话中共享系统提示词
追求比vLLM更快的推理速度
npx skills add Orchestra-Research/AI-Research-SKILLs --skill sglang -g -y
Dependencies:
sglang
torch
transformers
用于在 NVIDIA GPU 上优化大语言模型推理,提供高吞吐、低延迟及量化支持。适用于生产环境部署、多卡扩展及实时服务场景。
需要在 NVIDIA GPU 上部署 LLM 以获得极致性能
需要对模型进行 FP8/INT4 量化以降低延迟和内存占用
需要构建支持多 GPU 并行和高并发的推理服务
npx skills add Orchestra-Research/AI-Research-SKILLs --skill tensorrt-llm -g -y
Dependencies:
tensorrt-llm
torch


