Agent Skills
› Orchestra-Research/AI-Research-SKILLs
Orchestra-Research/AI-Research-SKILLs
GitHub提供基于LitGPT的LLM实现、训练及微调指南,支持Llama等20+模型。涵盖从模型加载、数据准备到全量或LoRA微调的全流程,适用于教育理解、代码参考及生产环境高效微调。
Install All Skills
npx skills add Orchestra-Research/AI-Research-SKILLs --all -g -y
Skills in Collection (96)
Showing top 50 of 96 by quality score. Use the install list command or open individual skills for the rest.
提供基于LitGPT的LLM实现、训练及微调指南,支持Llama等20+模型。涵盖从模型加载、数据准备到全量或LoRA微调的全流程,适用于教育理解、代码参考及生产环境高效微调。
需要快速上手LLM微调
寻找干净的LLM源码实现
在有限GPU资源下进行LoRA微调
npx skills add Orchestra-Research/AI-Research-SKILLs --skill implementing-llms-litgpt -g -y
Dependencies:
litgpt
torch
transformers
提供Mamba选择性状态空间模型的安装、基础用法及预训练模型加载指南,支持Mamba-1/2架构的序列建模与文本生成。
安装或配置Mamba相关库
使用Mamba架构进行语言模型推理或微调
从HuggingFace加载预训练的Mamba模型
npx skills add Orchestra-Research/AI-Research-SKILLs --skill mamba-architecture -g -y
Dependencies:
mamba-ssm
torch
transformers
causal-conv1d
介绍RWKV模型的使用,涵盖安装、并行训练与顺序推理两种模式、流式文本生成及长上下文处理。包含微调流程及与Transformer的性能对比,旨在展示其线性计算与无限上下文优势。
需要实现高效序列生成或长文本处理
询问RWKV模型的安装与配置方法
对比RWKV与Transformer的内存或速度差异
寻求RWKV模型的微调教程
npx skills add Orchestra-Research/AI-Research-SKILLs --skill rwkv-architecture -g -y
Dependencies:
rwkv
torch
transformers
提供基于PyTorch的原生分布式大语言模型预训练能力,支持4D并行策略及大规模GPU集群训练。适用于Llama等模型的规模化从头训练任务。
需要大规模分布式LLM预训练
配置FSDP/TP/PP并行策略
多节点SLURM环境训练
npx skills add Orchestra-Research/AI-Research-SKILLs --skill distributed-llm-pretraining-torchtitan -g -y
Dependencies:
torch>=2.6.0
torchtitan>=0.2.0
torchao>=0.5.0
提供高性能NLP分词工具,支持BPE等算法及自定义训练。用于快速处理文本、构建生产级流水线及对齐追踪,适用于需要高效数据预处理的研究与开发场景。
需要高性能文本分词
从零训练自定义分词器
构建NLP数据处理流水线
npx skills add Orchestra-Research/AI-Research-SKILLs --skill huggingface-tokenizers -g -y
SentencePiece是无监督语言无关分词器,支持BPE和Unigram算法。适用于多语言、CJK及需可重复分词的场景,提供轻量快速部署方案。
构建多语言模型
处理中日韩文本
需要确定性词汇表
训练原始文本分词器
npx skills add Orchestra-Research/AI-Research-SKILLs --skill sentencepiece -g -y
Dependencies:
sentencepiece
transformers
提供 Axolotl 大模型微调专家指导,涵盖 YAML 配置、LoRA/QLoRA、DPO/KTO 等对齐方法及多模态支持,辅助用户进行 LLM 开发、调试与最佳实践学习。
使用 Axolotl 进行大模型微调
查询 Axolotl 功能或 API
实现 Axolotl 解决方案
调试 Axolotl 代码
npx skills add Orchestra-Research/AI-Research-SKILLs --skill axolotl -g -y
提供LLaMA-Factory微调大语言模型的专业指导,涵盖WebUI、多模型支持、QLoRA及多模态功能。用于学习最佳实践、实现解决方案或调试代码。
使用llama-factory进行模型微调
查询llama-factory特性或API
实现llama-factory相关解决方案
调试llama-factory代码
npx skills add Orchestra-Research/AI-Research-SKILLs --skill llama-factory -g -y
提供LLM参数高效微调技能,支持LoRA/QLoRA等方法。适用于显存受限场景下对7B-70B大模型进行快速迭代与多适配器部署,以极小参数量训练实现低精度损失。
需要在大模型上进行微调但GPU显存不足
希望使用LoRA或QLoRA等高效方法快速适配多个任务
npx skills add Orchestra-Research/AI-Research-SKILLs --skill peft-fine-tuning -g -y
Dependencies:
peft>=0.13.0
transformers>=4.45.0
torch>=2.0.0
bitsandbytes>=0.43.0
提供使用nnsight库进行神经网络内部解释和操纵的指导,支持在本地小模型或远程大型模型(70B+)上运行可解释性实验。
需要分析PyTorch模型内部激活或注意力机制
需要在无本地GPU资源下对超大规模模型进行干预实验
npx skills add Orchestra-Research/AI-Research-SKILLs --skill nnsight-remote-interpretability -g -y
Dependencies:
nnsight>=0.5.0
torch>=2.0.0
提供基于PyTorch的因果干预指导,支持激活修补、因果追踪和交换干预训练。用于测试模型组件的因果假设及复现实验。
进行因果追踪或激活修补
执行交换干预训练
测试模型行为的因果假设
npx skills add Orchestra-Research/AI-Research-SKILLs --skill pyvene-interventions -g -y
Dependencies:
pyvene>=0.1.8
torch>=2.0.0
transformers>=4.30.0
提供使用SAELens训练和分析稀疏自编码器的指导,用于将神经网络激活分解为可解释特征。适用于发现模型内部概念、研究超位现象及分析安全相关特征的场景。
发现模型中的可解释特征
分析神经网络的超位现象
研究单义性表示
npx skills add Orchestra-Research/AI-Research-SKILLs --skill sparse-autoencoder-training -g -y
Dependencies:
sae-lens>=6.0.0
transformer-lens>=2.0.0
torch>=2.0.0
提供使用TransformerLens进行机械可解释性研究的指南,支持检查Transformer内部机制、激活缓存及因果追踪实验。
逆向工程模型训练算法
研究注意力模式和信息流
执行激活补丁或因果追踪实验
npx skills add Orchestra-Research/AI-Research-SKILLs --skill transformer-lens-interpretability -g -y
Dependencies:
transformer-lens>=2.0.0
torch>=2.0.0
NVIDIA GPU加速LLM训练数据清洗工具,支持多模态数据的模糊去重、质量过滤、PII脱敏和NSFW检测,显著提升数据处理效率。
准备LLM训练数据集
大规模文本/多模态数据去重
清洗网页爬取数据
过滤低质量或有毒内容
npx skills add Orchestra-Research/AI-Research-SKILLs --skill nemo-curator -g -y
Dependencies:
nemo-curator
cudf
dask
rapids
用于大规模机器学习数据处理的分布式库,支持流式执行、GPU加速及多模态数据加载。适用于超过100GB数据集的预处理、批量推理管道构建及分布式ETL任务。
处理大规模ML训练数据集
构建分布式数据预处理管道
需要多模态数据加载
npx skills add Orchestra-Research/AI-Research-SKILLs --skill ray-data -g -y
Dependencies:
ray[data]
pyarrow
pandas
提供基于TRL库的GRPO强化学习微调专家指导,涵盖算法原理、奖励函数设计及数据集准备,用于提升模型推理能力与格式规范。
需要进行大模型强化学习微调
需要自定义奖励函数优化输出格式或推理过程
实施Group Relative Policy Optimization
npx skills add Orchestra-Research/AI-Research-SKILLs --skill grpo-rl-training -g -y
Dependencies:
transformers>=4.47.0
trl>=0.14.0
datasets>=3.2.0
peft>=0.14.0
torch
指导使用miles框架进行企业级大规模模型强化学习训练,支持MoE、低精度量化及推理对齐。
需要训练超大规模MoE模型
需要进行FP8/INT4低精度训练
需要实现训练与推理的位级对齐
npx skills add Orchestra-Research/AI-Research-SKILLs --skill miles-rl-training -g -y
Dependencies:
sglang-router>=0.2.3
ray
torch>=2.0.0
transformers>=4.40.0
高性能RLHF训练框架,基于Ray和vLLM加速,支持PPO、GRPO等算法,用于大模型分布式训练与优化。
进行大模型强化学习微调
执行RLHF相关训练任务
npx skills add Orchestra-Research/AI-Research-SKILLs --skill openrlhf-training -g -y
Dependencies:
openrlhf
ray
vllm
torch
transformers
deepspeed
SimPO是一种无需参考模型的偏好优化方法,用于大语言模型对齐。提供从基座或指令模型训练的完整工作流及配置示例,旨在实现比DPO/PPO更简单高效的训练过程。
需要LLM偏好对齐
执行SimPO模型训练
配置深度学习训练参数
npx skills add Orchestra-Research/AI-Research-SKILLs --skill simpo-training -g -y
提供基于 Megatron+SGLang 的 LLM RL 后训练指导,支持 GLM/Qwen 等模型训练、自定义数据生成及大规模 RL 扩展。
LLM RL 后训练
Megatron-LM 集成
GLM 模型训练
npx skills add Orchestra-Research/AI-Research-SKILLs --skill slime-rl-training -g -y
Dependencies:
sglang-router>=0.2.3
ray
torch>=2.0.0
transformers>=4.40.0
提供基于PyTorch的Agentic RL训练指导,支持算法与基础设施分离、分布式训练及GRPO等算法实验。适用于快速RL研究、模型并行训练及可扩展的强化学习开发场景。
需要进行强化学习算法实验
配置分布式RL训练环境
使用torchforge库进行模型训练
npx skills add Orchestra-Research/AI-Research-SKILLs --skill torchforge-rl-training -g -y
Dependencies:
torch>=2.9.0
torchtitan>=0.2.0
vllm
monarch
基于TRL库对LLM进行强化学习微调,涵盖SFT、DPO、PPO及奖励模型训练。用于指令微调、偏好对齐及人类反馈优化,支持HuggingFace生态。
需要对大语言模型进行指令微调
需要基于人类偏好数据对齐模型输出
需要执行完整的RLHF训练流程
需要训练奖励模型或优化策略
npx skills add Orchestra-Research/AI-Research-SKILLs --skill fine-tuning-with-trl -g -y
提供使用verl库进行大规模LLM强化学习训练的指导,支持PPO、GRPO等算法及多后端切换,适用于RLHF和模型后训练场景。
需要实现LLM的RLHF或强化学习训练
配置PPO、GRPO等RL算法的训练流程
npx skills add Orchestra-Research/AI-Research-SKILLs --skill verl-rl-training -g -y
Dependencies:
verl>=0.3.0
torch>=2.0.0
ray>=2.41.0
vllm>=0.8.2
transformers>=4.40.0
实现Anthropic的Constitutional AI方法,通过自我批评和AI反馈训练模型安全性。包含监督学习(自我修正)和强化学习(RLAIF)两个阶段,无需人类标签即可减少有害输出,提升模型合规性。
需要训练或对齐大语言模型的安全性
希望使用AI反馈替代人工标注进行安全优化
实施Constitutional AI流程
npx skills add Orchestra-Research/AI-Research-SKILLs --skill constitutional-ai -g -y
Dependencies:
transformers
torch
trl
LlamaGuard是Meta推出的AI内容安全过滤模型,用于检测输入输出中的暴力、仇恨、色情等违规内容。提供输入/输出过滤工作流及vLLM部署方案,保障LLM应用合规性。
需要审核用户提示词安全性
需要过滤大模型生成内容的风险
部署AI内容审查服务
npx skills add Orchestra-Research/AI-Research-SKILLs --skill llamaguard -g -y
Dependencies:
transformers
torch
vllm
NVIDIA NeMo Guardrails 运行时安全框架,通过 Colang DSL 为 LLM 应用提供编程式安全防护。支持越狱检测、输入输出校验、事实核查、幻觉检测及敏感信息过滤,保障 AI 应用合规与安全。
LLM 应用安全防护需求
需要检测或拦截提示词注入/越狱攻击
要求对 LLM 输入输出进行合规性校验
需要过滤 PII 或毒性内容
npx skills add Orchestra-Research/AI-Research-SKILLs --skill nemo-guardrails -g -y
Dependencies:
nemoguardrails
用于检测LLM应用中的提示注入和越狱攻击的安全工具。通过分类良性、注入和越狱内容,保护用户输入及第三方数据(如RAG文档),防止恶意指令执行。
需要防护LLM免受提示注入攻击
过滤包含恶意指令的用户输入或外部数据
npx skills add Orchestra-Research/AI-Research-SKILLs --skill prompt-guard -g -y
Dependencies:
transformers
torch
HuggingFace Accelerate库,用于简化PyTorch分布式训练。提供统一API支持DeepSpeed/FSDP等后端,实现自动设备放置、混合精度及多机多卡配置,仅需少量代码即可扩展模型训练。
需要将单GPU PyTorch脚本转换为多GPU或分布式训练
需要配置和使用混合精度(FP16/BF16/FP8)进行模型训练
npx skills add Orchestra-Research/AI-Research-SKILLs --skill huggingface-accelerate -g -y
Dependencies:
accelerate
torch
transformers
提供 DeepSpeed 分布式训练专家指导,涵盖 ZeRO 优化、并行策略及 DeepNVMe 高性能 I/O 操作。适用于配置环境、API 使用、代码实现与调试,旨在加速深度学习模型训练效率。
DeepSpeed 分布式训练配置
ZeRO 优化阶段设置
DeepNVMe 数据加载优化
FP16/BF16/FP8 混合精度训练
调试 DeepSpeed 相关代码
npx skills add Orchestra-Research/AI-Research-SKILLs --skill deepspeed -g -y
Dependencies:
deepspeed
torch
transformers
accelerate
基于NVIDIA Megatron-Core的大规模LLM训练技能,支持2B-462B参数模型,提供3D并行及MoE配置指南。
需要训练超过1B参数的LLM
追求H100上最高GPU效率
需要配置张量/流水线/专家并行
npx skills add Orchestra-Research/AI-Research-SKILLs --skill training-llms-megatron -g -y
指导在PyTorch训练脚本中正确集成FSDP2,包括初始化、分片、混合精度及分布式检查点,解决单卡显存不足问题。
模型超出单GPU显存限制
需要基于DTensor的参数级分片
配置分布式训练环境
npx skills add Orchestra-Research/AI-Research-SKILLs --skill pytorch-fsdp2 -g -y
Dependencies:
torch
PyTorch Lightning是高级训练框架,通过Trainer类简化代码,自动处理分布式训练、混合精度及日志记录等 boilerplate,使模型从笔记本扩展至超算无需改动代码。
需要简化PyTorch训练循环
配置分布式或混合精度训练
自动化模型验证与测试流程
npx skills add Orchestra-Research/AI-Research-SKILLs --skill pytorch-lightning -g -y
Dependencies:
lightning
torch
transformers
Ray Train用于分布式机器学习训练编排,支持PyTorch/TensorFlow/HuggingFace从单节点扩展到千级节点。内置超参调优、容错和弹性伸缩,适用于大规模模型训练及分布式超参搜索场景。
需要跨多节点或GPU集群进行大规模模型训练
运行分布式超参数搜索或自动调优任务
将现有单机训练代码扩展为分布式训练
npx skills add Orchestra-Research/AI-Research-SKILLs --skill ray-train -g -y
Dependencies:
ray[train]
torch
transformers
提供Lambda Labs GPU云平台的ML训练与推理指南,涵盖实例选择、SSH连接及预装环境配置,适用于需要高性能GPU集群和持久化存储的场景。
需要租赁GPU云服务器进行模型训练
配置多节点GPU分布式训练集群
查询不同GPU型号的性价比与适用场景
npx skills add Orchestra-Research/AI-Research-SKILLs --skill lambda-labs-gpu-cloud -g -y
Dependencies:
lambda-cloud-client>=1.0.0
提供在Modal无服务器GPU平台运行ML工作流的指南,涵盖安装、GPU配置及部署模型API或批处理任务的最佳实践。
需要按需GPU资源运行机器学习任务
将ML模型部署为自动扩缩的REST API
执行无需管理基础设施的批量数据处理
npx skills add Orchestra-Research/AI-Research-SKILLs --skill modal-serverless-gpu -g -y
Dependencies:
modal>=0.64.0
SkyPilot多云ML工作负载编排技能,支持跨云自动成本优化、Spot实例自动恢复及分布式训练。
需要跨多个云平台运行机器学习训练任务
希望通过自动选择最便宜区域或Spot实例来优化GPU成本
需要管理具有自动恢复功能的长时间运行批量作业
npx skills add Orchestra-Research/AI-Research-SKILLs --skill skypilot-multi-cloud-orchestration -g -y
Dependencies:
skypilot>=0.7.0
提供LLM的4位激活感知权重量化方案,实现3倍推理加速且精度损失极小。适用于在显存受限GPU上部署大模型、提升vLLM生产服务性能及支持指令微调/多模态模型的场景。
需要部署7B-70B大模型但GPU显存不足
追求比GPTQ更快的推理速度且保持高精度
使用vLLM进行生产环境模型服务
对Ampere及以上架构GPU进行模型压缩
npx skills add Orchestra-Research/AI-Research-SKILLs --skill awq-quantization -g -y
Dependencies:
autoawq
transformers>=4.45.0
torch>=2.0.0
提供LLM量化指南,支持8-bit/4-bit压缩以大幅降低显存占用并加速推理。涵盖模型加载配置、QLoRA微调及内存估算,适用于GPU资源受限场景下的模型部署与优化。
需要减少大语言模型显存占用
在有限GPU上运行大型模型
进行LLM量化或QLoRA微调
npx skills add Orchestra-Research/AI-Research-SKILLs --skill quantizing-models-bitsandbytes -g -y
Dependencies:
bitsandbytes
transformers
accelerate
torch
提供Flash Attention集成指南,通过IO感知分块优化Transformer注意力机制,实现2-4倍加速和10-20倍内存节省。适用于长序列训练、推理及解决GPU显存瓶颈。
需要优化Transformer模型训练或推理速度
遇到GPU显存不足导致OOM错误
处理超过512 token的长序列场景
npx skills add Orchestra-Research/AI-Research-SKILLs --skill optimizing-attention-flash -g -y
Dependencies:
flash-attn
torch
transformers
提供GGUF格式与llama.cpp量化指南,支持CPU/Apple Silicon高效推理。涵盖模型转换、多级别量化(Q2-Q8)及CLI运行,适用于消费级硬件部署。
在本地或消费级硬件上部署LLM
需要将HuggingFace模型转换为GGUF格式
执行模型量化以降低内存占用
使用llama.cpp进行CPU或Metal加速推理
npx skills add Orchestra-Research/AI-Research-SKILLs --skill gguf-quantization -g -y
Dependencies:
llama-cpp-python>=0.2.0
提供LLM后训练4-bit量化方案,实现显存降低4倍及推理加速。支持加载预量化模型或基于校准数据自行量化,适用于在消费级GPU上部署大型语言模型。
需要在有限显存的GPU上运行大型语言模型
需要对LLM进行4-bit量化以减少内存占用
需要提升大模型的推理速度
npx skills add Orchestra-Research/AI-Research-SKILLs --skill gptq -g -y
Dependencies:
auto-gptq
transformers
optimum
peft
提供无需校准数据的LLM快速权重量化方案,支持1-8位精度及多后端。适用于vLLM/HF部署、LoRA微调及极端量化实验,相比AWQ/GPTQ更快且免数据集。
需要对大模型进行4/3/2/1-bit量化
缺乏校准数据需要快速量化
使用vLLM或HuggingFace部署量化模型
对量化模型进行LoRA微调
npx skills add Orchestra-Research/AI-Research-SKILLs --skill hqq-quantization -g -y
Dependencies:
hqq>=0.2.0
torch>=2.0.0
提供PyTorch深度学习训练的最佳实践,涵盖模型架构选择、优化器配置、混合精度训练及多领域(LLM、视觉、生物医学)微调与调试指南。
需要选择或设计神经网络架构
进行模型训练或微调
调试损失异常或OOM问题
优化GPU训练吞吐量
npx skills add Orchestra-Research/AI-Research-SKILLs --skill ml-training-recipes -g -y
Dependencies:
torch>=2.0.0
BigCode评估工具,用于在HumanEval等15+基准上测试代码生成模型。支持多语言、量化模型及自定义配置,通过pass@k指标衡量代码质量与能力。
评估代码生成模型性能
对比不同模型的编码能力
测试多语言代码支持情况
运行标准代码基准测试
npx skills add Orchestra-Research/AI-Research-SKILLs --skill evaluating-code-models -g -y
Dependencies:
bigcode-evaluation-harness
transformers>=4.25.1
accelerate>=0.13.2
datasets>=2.6.1
用于评估大语言模型在60多个学术基准测试(如MMLU、HumanEval)上的表现。支持HuggingFace、vLLM及API,适用于模型质量对比、训练进度追踪及学术结果报告。
需要评估或对比大语言模型的基准测试分数
跟踪模型训练进展并生成标准化评测报告
验证模型在特定学术任务(如推理、代码生成)上的能力
npx skills add Orchestra-Research/AI-Research-SKILLs --skill evaluating-llms-harness -g -y
Dependencies:
lm-eval
transformers
vllm
提供 llama.cpp 在 CPU、Apple Silicon 及非 NVIDIA GPU 上的本地 LLM 推理方案,支持 GGUF 量化与边缘部署。
需要在无 CUDA 环境运行 LLM
Edge 设备或 Mac 上部署 AI 模型
优化本地推理速度与内存占用
npx skills add Orchestra-Research/AI-Research-SKILLs --skill llama-cpp -g -y
Dependencies:
llama-cpp-python
高性能LLM/VLM推理服务框架,支持结构化输出、RadixAttention前缀缓存及Agent工作流。适用于需JSON/正则约束解码、多轮对话共享上下文或追求高吞吐低延迟的场景。
需要结构化输出(JSON/正则)
构建带有重复前缀的Agent应用
多轮对话且需共享上下文
需要比vLLM更快的推理速度
npx skills add Orchestra-Research/AI-Research-SKILLs --skill sglang -g -y
Dependencies:
sglang
torch
transformers
用于在NVIDIA GPU上优化LLM推理性能,提供高吞吐和低延迟部署方案。支持量化、多卡扩展及动态批处理,适用于生产环境模型服务。
需要最大化LLM推理吞吐量
降低实时应用推理延迟
在NVIDIA GPU上部署量化模型
npx skills add Orchestra-Research/AI-Research-SKILLs --skill tensorrt-llm -g -y
Dependencies:
tensorrt-llm
torch


