Agent Skills › Orchestra-Research/AI-Research-SKILLs

Orchestra-Research/AI-Research-SKILLs

GitHub

提供基于LitGPT的LLM实现、训练及微调指南,支持Llama等20+模型。涵盖从模型加载、数据准备到全量或LoRA微调的全流程,适用于教育理解、代码参考及生产环境高效微调。

96 skills 12,948

Install All Skills

npx skills add Orchestra-Research/AI-Research-SKILLs --all -g -y
More Options

List skills in collection

npx skills add Orchestra-Research/AI-Research-SKILLs --list

Skills in Collection (96)

Showing top 50 of 96 by quality score. Use the install list command or open individual skills for the rest.

提供基于LitGPT的LLM实现、训练及微调指南,支持Llama等20+模型。涵盖从模型加载、数据准备到全量或LoRA微调的全流程,适用于教育理解、代码参考及生产环境高效微调。
需要快速上手LLM微调 寻找干净的LLM源码实现 在有限GPU资源下进行LoRA微调
01-model-architecture/litgpt/SKILL.md
npx skills add Orchestra-Research/AI-Research-SKILLs --skill implementing-llms-litgpt -g -y
Dependencies: litgpt torch transformers
提供Mamba选择性状态空间模型的安装、基础用法及预训练模型加载指南,支持Mamba-1/2架构的序列建模与文本生成。
安装或配置Mamba相关库 使用Mamba架构进行语言模型推理或微调 从HuggingFace加载预训练的Mamba模型
01-model-architecture/mamba/SKILL.md
npx skills add Orchestra-Research/AI-Research-SKILLs --skill mamba-architecture -g -y
Dependencies: mamba-ssm torch transformers causal-conv1d
nanoGPT是极简GPT实现,用于学习和实验。支持在Shakespeare数据集上进行CPU友好的训练及文本生成,也可在多GPU环境下复现GPT-2模型或进行微调。提供完整的配置和工作流指南。
需要学习Transformer架构原理 快速搭建GPT模型进行实验 在有限资源下训练小型语言模型 复现GPT-2基准结果
01-model-architecture/nanogpt/SKILL.md
npx skills add Orchestra-Research/AI-Research-SKILLs --skill nanogpt -g -y
Dependencies: torch transformers datasets tiktoken wandb
介绍RWKV模型的使用,涵盖安装、并行训练与顺序推理两种模式、流式文本生成及长上下文处理。包含微调流程及与Transformer的性能对比,旨在展示其线性计算与无限上下文优势。
需要实现高效序列生成或长文本处理 询问RWKV模型的安装与配置方法 对比RWKV与Transformer的内存或速度差异 寻求RWKV模型的微调教程
01-model-architecture/rwkv/SKILL.md
npx skills add Orchestra-Research/AI-Research-SKILLs --skill rwkv-architecture -g -y
Dependencies: rwkv torch transformers
提供基于PyTorch的原生分布式大语言模型预训练能力,支持4D并行策略及大规模GPU集群训练。适用于Llama等模型的规模化从头训练任务。
需要大规模分布式LLM预训练 配置FSDP/TP/PP并行策略 多节点SLURM环境训练
01-model-architecture/torchtitan/SKILL.md
npx skills add Orchestra-Research/AI-Research-SKILLs --skill distributed-llm-pretraining-torchtitan -g -y
Dependencies: torch>=2.6.0 torchtitan>=0.2.0 torchao>=0.5.0
提供高性能NLP分词工具,支持BPE等算法及自定义训练。用于快速处理文本、构建生产级流水线及对齐追踪,适用于需要高效数据预处理的研究与开发场景。
需要高性能文本分词 从零训练自定义分词器 构建NLP数据处理流水线
02-tokenization/huggingface-tokenizers/SKILL.md
npx skills add Orchestra-Research/AI-Research-SKILLs --skill huggingface-tokenizers -g -y
Dependencies: tokenizers transformers datasets
SentencePiece是无监督语言无关分词器,支持BPE和Unigram算法。适用于多语言、CJK及需可重复分词的场景,提供轻量快速部署方案。
构建多语言模型 处理中日韩文本 需要确定性词汇表 训练原始文本分词器
02-tokenization/sentencepiece/SKILL.md
npx skills add Orchestra-Research/AI-Research-SKILLs --skill sentencepiece -g -y
Dependencies: sentencepiece transformers
提供 Axolotl 大模型微调专家指导,涵盖 YAML 配置、LoRA/QLoRA、DPO/KTO 等对齐方法及多模态支持,辅助用户进行 LLM 开发、调试与最佳实践学习。
使用 Axolotl 进行大模型微调 查询 Axolotl 功能或 API 实现 Axolotl 解决方案 调试 Axolotl 代码
03-fine-tuning/axolotl/SKILL.md
npx skills add Orchestra-Research/AI-Research-SKILLs --skill axolotl -g -y
Dependencies: axolotl torch transformers datasets peft accelerate deepspeed
提供LLaMA-Factory微调大语言模型的专业指导,涵盖WebUI、多模型支持、QLoRA及多模态功能。用于学习最佳实践、实现解决方案或调试代码。
使用llama-factory进行模型微调 查询llama-factory特性或API 实现llama-factory相关解决方案 调试llama-factory代码
03-fine-tuning/llama-factory/SKILL.md
npx skills add Orchestra-Research/AI-Research-SKILLs --skill llama-factory -g -y
Dependencies: llmtuner torch transformers datasets peft accelerate gradio
提供LLM参数高效微调技能,支持LoRA/QLoRA等方法。适用于显存受限场景下对7B-70B大模型进行快速迭代与多适配器部署,以极小参数量训练实现低精度损失。
需要在大模型上进行微调但GPU显存不足 希望使用LoRA或QLoRA等高效方法快速适配多个任务
03-fine-tuning/peft/SKILL.md
npx skills add Orchestra-Research/AI-Research-SKILLs --skill peft-fine-tuning -g -y
Dependencies: peft>=0.13.0 transformers>=4.45.0 torch>=2.0.0 bitsandbytes>=0.43.0
提供Unsloth快速微调LLM的专家指导,涵盖2-5倍加速训练、内存优化及LoRA/QLoRA配置。适用于使用Unsloth进行模型开发、API查询、代码实现与调试。
需要加速大语言模型微调时 咨询Unsloth特性或API用法 实施Unsloth解决方案 调试Unsloth相关代码
03-fine-tuning/unsloth/SKILL.md
npx skills add Orchestra-Research/AI-Research-SKILLs --skill unsloth -g -y
Dependencies: unsloth torch transformers trl datasets peft
提供使用nnsight库进行神经网络内部解释和操纵的指导,支持在本地小模型或远程大型模型(70B+)上运行可解释性实验。
需要分析PyTorch模型内部激活或注意力机制 需要在无本地GPU资源下对超大规模模型进行干预实验
04-mechanistic-interpretability/nnsight/SKILL.md
npx skills add Orchestra-Research/AI-Research-SKILLs --skill nnsight-remote-interpretability -g -y
Dependencies: nnsight>=0.5.0 torch>=2.0.0
提供基于PyTorch的因果干预指导,支持激活修补、因果追踪和交换干预训练。用于测试模型组件的因果假设及复现实验。
进行因果追踪或激活修补 执行交换干预训练 测试模型行为的因果假设
04-mechanistic-interpretability/pyvene/SKILL.md
npx skills add Orchestra-Research/AI-Research-SKILLs --skill pyvene-interventions -g -y
Dependencies: pyvene>=0.1.8 torch>=2.0.0 transformers>=4.30.0
提供使用SAELens训练和分析稀疏自编码器的指导,用于将神经网络激活分解为可解释特征。适用于发现模型内部概念、研究超位现象及分析安全相关特征的场景。
发现模型中的可解释特征 分析神经网络的超位现象 研究单义性表示
04-mechanistic-interpretability/saelens/SKILL.md
npx skills add Orchestra-Research/AI-Research-SKILLs --skill sparse-autoencoder-training -g -y
Dependencies: sae-lens>=6.0.0 transformer-lens>=2.0.0 torch>=2.0.0
提供使用TransformerLens进行机械可解释性研究的指南,支持检查Transformer内部机制、激活缓存及因果追踪实验。
逆向工程模型训练算法 研究注意力模式和信息流 执行激活补丁或因果追踪实验
04-mechanistic-interpretability/transformer-lens/SKILL.md
npx skills add Orchestra-Research/AI-Research-SKILLs --skill transformer-lens-interpretability -g -y
Dependencies: transformer-lens>=2.0.0 torch>=2.0.0
NVIDIA GPU加速LLM训练数据清洗工具,支持多模态数据的模糊去重、质量过滤、PII脱敏和NSFW检测,显著提升数据处理效率。
准备LLM训练数据集 大规模文本/多模态数据去重 清洗网页爬取数据 过滤低质量或有毒内容
05-data-processing/nemo-curator/SKILL.md
npx skills add Orchestra-Research/AI-Research-SKILLs --skill nemo-curator -g -y
Dependencies: nemo-curator cudf dask rapids
用于大规模机器学习数据处理的分布式库,支持流式执行、GPU加速及多模态数据加载。适用于超过100GB数据集的预处理、批量推理管道构建及分布式ETL任务。
处理大规模ML训练数据集 构建分布式数据预处理管道 需要多模态数据加载
05-data-processing/ray-data/SKILL.md
npx skills add Orchestra-Research/AI-Research-SKILLs --skill ray-data -g -y
Dependencies: ray[data] pyarrow pandas
提供基于TRL库的GRPO强化学习微调专家指导,涵盖算法原理、奖励函数设计及数据集准备,用于提升模型推理能力与格式规范。
需要进行大模型强化学习微调 需要自定义奖励函数优化输出格式或推理过程 实施Group Relative Policy Optimization
06-post-training/grpo-rl-training/SKILL.md
npx skills add Orchestra-Research/AI-Research-SKILLs --skill grpo-rl-training -g -y
Dependencies: transformers>=4.47.0 trl>=0.14.0 datasets>=3.2.0 peft>=0.14.0 torch
指导使用miles框架进行企业级大规模模型强化学习训练,支持MoE、低精度量化及推理对齐。
需要训练超大规模MoE模型 需要进行FP8/INT4低精度训练 需要实现训练与推理的位级对齐
06-post-training/miles/SKILL.md
npx skills add Orchestra-Research/AI-Research-SKILLs --skill miles-rl-training -g -y
Dependencies: sglang-router>=0.2.3 ray torch>=2.0.0 transformers>=4.40.0
高性能RLHF训练框架,基于Ray和vLLM加速,支持PPO、GRPO等算法,用于大模型分布式训练与优化。
进行大模型强化学习微调 执行RLHF相关训练任务
06-post-training/openrlhf/SKILL.md
npx skills add Orchestra-Research/AI-Research-SKILLs --skill openrlhf-training -g -y
Dependencies: openrlhf ray vllm torch transformers deepspeed
SimPO是一种无需参考模型的偏好优化方法,用于大语言模型对齐。提供从基座或指令模型训练的完整工作流及配置示例,旨在实现比DPO/PPO更简单高效的训练过程。
需要LLM偏好对齐 执行SimPO模型训练 配置深度学习训练参数
06-post-training/simpo/SKILL.md
npx skills add Orchestra-Research/AI-Research-SKILLs --skill simpo-training -g -y
Dependencies: torch transformers datasets trl accelerate
提供基于 Megatron+SGLang 的 LLM RL 后训练指导,支持 GLM/Qwen 等模型训练、自定义数据生成及大规模 RL 扩展。
LLM RL 后训练 Megatron-LM 集成 GLM 模型训练
06-post-training/slime/SKILL.md
npx skills add Orchestra-Research/AI-Research-SKILLs --skill slime-rl-training -g -y
Dependencies: sglang-router>=0.2.3 ray torch>=2.0.0 transformers>=4.40.0
提供基于PyTorch的Agentic RL训练指导,支持算法与基础设施分离、分布式训练及GRPO等算法实验。适用于快速RL研究、模型并行训练及可扩展的强化学习开发场景。
需要进行强化学习算法实验 配置分布式RL训练环境 使用torchforge库进行模型训练
06-post-training/torchforge/SKILL.md
npx skills add Orchestra-Research/AI-Research-SKILLs --skill torchforge-rl-training -g -y
Dependencies: torch>=2.9.0 torchtitan>=0.2.0 vllm monarch
基于TRL库对LLM进行强化学习微调,涵盖SFT、DPO、PPO及奖励模型训练。用于指令微调、偏好对齐及人类反馈优化,支持HuggingFace生态。
需要对大语言模型进行指令微调 需要基于人类偏好数据对齐模型输出 需要执行完整的RLHF训练流程 需要训练奖励模型或优化策略
06-post-training/trl-fine-tuning/SKILL.md
npx skills add Orchestra-Research/AI-Research-SKILLs --skill fine-tuning-with-trl -g -y
Dependencies: trl transformers datasets peft accelerate torch
提供使用verl库进行大规模LLM强化学习训练的指导,支持PPO、GRPO等算法及多后端切换,适用于RLHF和模型后训练场景。
需要实现LLM的RLHF或强化学习训练 配置PPO、GRPO等RL算法的训练流程
06-post-training/verl/SKILL.md
npx skills add Orchestra-Research/AI-Research-SKILLs --skill verl-rl-training -g -y
Dependencies: verl>=0.3.0 torch>=2.0.0 ray>=2.41.0 vllm>=0.8.2 transformers>=4.40.0
实现Anthropic的Constitutional AI方法,通过自我批评和AI反馈训练模型安全性。包含监督学习(自我修正)和强化学习(RLAIF)两个阶段,无需人类标签即可减少有害输出,提升模型合规性。
需要训练或对齐大语言模型的安全性 希望使用AI反馈替代人工标注进行安全优化 实施Constitutional AI流程
07-safety-alignment/constitutional-ai/SKILL.md
npx skills add Orchestra-Research/AI-Research-SKILLs --skill constitutional-ai -g -y
Dependencies: transformers torch trl
LlamaGuard是Meta推出的AI内容安全过滤模型,用于检测输入输出中的暴力、仇恨、色情等违规内容。提供输入/输出过滤工作流及vLLM部署方案,保障LLM应用合规性。
需要审核用户提示词安全性 需要过滤大模型生成内容的风险 部署AI内容审查服务
07-safety-alignment/llamaguard/SKILL.md
npx skills add Orchestra-Research/AI-Research-SKILLs --skill llamaguard -g -y
Dependencies: transformers torch vllm
NVIDIA NeMo Guardrails 运行时安全框架,通过 Colang DSL 为 LLM 应用提供编程式安全防护。支持越狱检测、输入输出校验、事实核查、幻觉检测及敏感信息过滤,保障 AI 应用合规与安全。
LLM 应用安全防护需求 需要检测或拦截提示词注入/越狱攻击 要求对 LLM 输入输出进行合规性校验 需要过滤 PII 或毒性内容
07-safety-alignment/nemo-guardrails/SKILL.md
npx skills add Orchestra-Research/AI-Research-SKILLs --skill nemo-guardrails -g -y
Dependencies: nemoguardrails
用于检测LLM应用中的提示注入和越狱攻击的安全工具。通过分类良性、注入和越狱内容,保护用户输入及第三方数据(如RAG文档),防止恶意指令执行。
需要防护LLM免受提示注入攻击 过滤包含恶意指令的用户输入或外部数据
07-safety-alignment/prompt-guard/SKILL.md
npx skills add Orchestra-Research/AI-Research-SKILLs --skill prompt-guard -g -y
Dependencies: transformers torch
HuggingFace Accelerate库,用于简化PyTorch分布式训练。提供统一API支持DeepSpeed/FSDP等后端,实现自动设备放置、混合精度及多机多卡配置,仅需少量代码即可扩展模型训练。
需要将单GPU PyTorch脚本转换为多GPU或分布式训练 需要配置和使用混合精度(FP16/BF16/FP8)进行模型训练
08-distributed-training/accelerate/SKILL.md
npx skills add Orchestra-Research/AI-Research-SKILLs --skill huggingface-accelerate -g -y
Dependencies: accelerate torch transformers
提供 DeepSpeed 分布式训练专家指导,涵盖 ZeRO 优化、并行策略及 DeepNVMe 高性能 I/O 操作。适用于配置环境、API 使用、代码实现与调试,旨在加速深度学习模型训练效率。
DeepSpeed 分布式训练配置 ZeRO 优化阶段设置 DeepNVMe 数据加载优化 FP16/BF16/FP8 混合精度训练 调试 DeepSpeed 相关代码
08-distributed-training/deepspeed/SKILL.md
npx skills add Orchestra-Research/AI-Research-SKILLs --skill deepspeed -g -y
Dependencies: deepspeed torch transformers accelerate
基于NVIDIA Megatron-Core的大规模LLM训练技能,支持2B-462B参数模型,提供3D并行及MoE配置指南。
需要训练超过1B参数的LLM 追求H100上最高GPU效率 需要配置张量/流水线/专家并行
08-distributed-training/megatron-core/SKILL.md
npx skills add Orchestra-Research/AI-Research-SKILLs --skill training-llms-megatron -g -y
Dependencies: megatron-core torch apex transformer-engine
指导在PyTorch训练脚本中正确集成FSDP2,包括初始化、分片、混合精度及分布式检查点,解决单卡显存不足问题。
模型超出单GPU显存限制 需要基于DTensor的参数级分片 配置分布式训练环境
08-distributed-training/pytorch-fsdp2/SKILL.md
npx skills add Orchestra-Research/AI-Research-SKILLs --skill pytorch-fsdp2 -g -y
Dependencies: torch
PyTorch Lightning是高级训练框架,通过Trainer类简化代码,自动处理分布式训练、混合精度及日志记录等 boilerplate,使模型从笔记本扩展至超算无需改动代码。
需要简化PyTorch训练循环 配置分布式或混合精度训练 自动化模型验证与测试流程
08-distributed-training/pytorch-lightning/SKILL.md
npx skills add Orchestra-Research/AI-Research-SKILLs --skill pytorch-lightning -g -y
Dependencies: lightning torch transformers
Ray Train用于分布式机器学习训练编排,支持PyTorch/TensorFlow/HuggingFace从单节点扩展到千级节点。内置超参调优、容错和弹性伸缩,适用于大规模模型训练及分布式超参搜索场景。
需要跨多节点或GPU集群进行大规模模型训练 运行分布式超参数搜索或自动调优任务 将现有单机训练代码扩展为分布式训练
08-distributed-training/ray-train/SKILL.md
npx skills add Orchestra-Research/AI-Research-SKILLs --skill ray-train -g -y
Dependencies: ray[train] torch transformers
提供Lambda Labs GPU云平台的ML训练与推理指南,涵盖实例选择、SSH连接及预装环境配置,适用于需要高性能GPU集群和持久化存储的场景。
需要租赁GPU云服务器进行模型训练 配置多节点GPU分布式训练集群 查询不同GPU型号的性价比与适用场景
09-infrastructure/lambda-labs/SKILL.md
npx skills add Orchestra-Research/AI-Research-SKILLs --skill lambda-labs-gpu-cloud -g -y
Dependencies: lambda-cloud-client>=1.0.0
提供在Modal无服务器GPU平台运行ML工作流的指南,涵盖安装、GPU配置及部署模型API或批处理任务的最佳实践。
需要按需GPU资源运行机器学习任务 将ML模型部署为自动扩缩的REST API 执行无需管理基础设施的批量数据处理
09-infrastructure/modal/SKILL.md
npx skills add Orchestra-Research/AI-Research-SKILLs --skill modal-serverless-gpu -g -y
Dependencies: modal>=0.64.0
SkyPilot多云ML工作负载编排技能,支持跨云自动成本优化、Spot实例自动恢复及分布式训练。
需要跨多个云平台运行机器学习训练任务 希望通过自动选择最便宜区域或Spot实例来优化GPU成本 需要管理具有自动恢复功能的长时间运行批量作业
09-infrastructure/skypilot/SKILL.md
npx skills add Orchestra-Research/AI-Research-SKILLs --skill skypilot-multi-cloud-orchestration -g -y
Dependencies: skypilot>=0.7.0
提供LLM的4位激活感知权重量化方案,实现3倍推理加速且精度损失极小。适用于在显存受限GPU上部署大模型、提升vLLM生产服务性能及支持指令微调/多模态模型的场景。
需要部署7B-70B大模型但GPU显存不足 追求比GPTQ更快的推理速度且保持高精度 使用vLLM进行生产环境模型服务 对Ampere及以上架构GPU进行模型压缩
10-optimization/awq/SKILL.md
npx skills add Orchestra-Research/AI-Research-SKILLs --skill awq-quantization -g -y
Dependencies: autoawq transformers>=4.45.0 torch>=2.0.0
提供LLM量化指南,支持8-bit/4-bit压缩以大幅降低显存占用并加速推理。涵盖模型加载配置、QLoRA微调及内存估算,适用于GPU资源受限场景下的模型部署与优化。
需要减少大语言模型显存占用 在有限GPU上运行大型模型 进行LLM量化或QLoRA微调
10-optimization/bitsandbytes/SKILL.md
npx skills add Orchestra-Research/AI-Research-SKILLs --skill quantizing-models-bitsandbytes -g -y
Dependencies: bitsandbytes transformers accelerate torch
提供Flash Attention集成指南,通过IO感知分块优化Transformer注意力机制,实现2-4倍加速和10-20倍内存节省。适用于长序列训练、推理及解决GPU显存瓶颈。
需要优化Transformer模型训练或推理速度 遇到GPU显存不足导致OOM错误 处理超过512 token的长序列场景
10-optimization/flash-attention/SKILL.md
npx skills add Orchestra-Research/AI-Research-SKILLs --skill optimizing-attention-flash -g -y
Dependencies: flash-attn torch transformers
提供GGUF格式与llama.cpp量化指南,支持CPU/Apple Silicon高效推理。涵盖模型转换、多级别量化(Q2-Q8)及CLI运行,适用于消费级硬件部署。
在本地或消费级硬件上部署LLM 需要将HuggingFace模型转换为GGUF格式 执行模型量化以降低内存占用 使用llama.cpp进行CPU或Metal加速推理
10-optimization/gguf/SKILL.md
npx skills add Orchestra-Research/AI-Research-SKILLs --skill gguf-quantization -g -y
Dependencies: llama-cpp-python>=0.2.0
提供LLM后训练4-bit量化方案,实现显存降低4倍及推理加速。支持加载预量化模型或基于校准数据自行量化,适用于在消费级GPU上部署大型语言模型。
需要在有限显存的GPU上运行大型语言模型 需要对LLM进行4-bit量化以减少内存占用 需要提升大模型的推理速度
10-optimization/gptq/SKILL.md
npx skills add Orchestra-Research/AI-Research-SKILLs --skill gptq -g -y
Dependencies: auto-gptq transformers optimum peft
提供无需校准数据的LLM快速权重量化方案,支持1-8位精度及多后端。适用于vLLM/HF部署、LoRA微调及极端量化实验,相比AWQ/GPTQ更快且免数据集。
需要对大模型进行4/3/2/1-bit量化 缺乏校准数据需要快速量化 使用vLLM或HuggingFace部署量化模型 对量化模型进行LoRA微调
10-optimization/hqq/SKILL.md
npx skills add Orchestra-Research/AI-Research-SKILLs --skill hqq-quantization -g -y
Dependencies: hqq>=0.2.0 torch>=2.0.0
提供PyTorch深度学习训练的最佳实践,涵盖模型架构选择、优化器配置、混合精度训练及多领域(LLM、视觉、生物医学)微调与调试指南。
需要选择或设计神经网络架构 进行模型训练或微调 调试损失异常或OOM问题 优化GPU训练吞吐量
10-optimization/ml-training-recipes/SKILL.md
npx skills add Orchestra-Research/AI-Research-SKILLs --skill ml-training-recipes -g -y
Dependencies: torch>=2.0.0
BigCode评估工具,用于在HumanEval等15+基准上测试代码生成模型。支持多语言、量化模型及自定义配置,通过pass@k指标衡量代码质量与能力。
评估代码生成模型性能 对比不同模型的编码能力 测试多语言代码支持情况 运行标准代码基准测试
11-evaluation/bigcode-evaluation-harness/SKILL.md
npx skills add Orchestra-Research/AI-Research-SKILLs --skill evaluating-code-models -g -y
Dependencies: bigcode-evaluation-harness transformers>=4.25.1 accelerate>=0.13.2 datasets>=2.6.1
用于评估大语言模型在60多个学术基准测试(如MMLU、HumanEval)上的表现。支持HuggingFace、vLLM及API,适用于模型质量对比、训练进度追踪及学术结果报告。
需要评估或对比大语言模型的基准测试分数 跟踪模型训练进展并生成标准化评测报告 验证模型在特定学术任务(如推理、代码生成)上的能力
11-evaluation/lm-evaluation-harness/SKILL.md
npx skills add Orchestra-Research/AI-Research-SKILLs --skill evaluating-llms-harness -g -y
Dependencies: lm-eval transformers vllm
提供 llama.cpp 在 CPU、Apple Silicon 及非 NVIDIA GPU 上的本地 LLM 推理方案,支持 GGUF 量化与边缘部署。
需要在无 CUDA 环境运行 LLM Edge 设备或 Mac 上部署 AI 模型 优化本地推理速度与内存占用
12-inference-serving/llama-cpp/SKILL.md
npx skills add Orchestra-Research/AI-Research-SKILLs --skill llama-cpp -g -y
Dependencies: llama-cpp-python
高性能LLM/VLM推理服务框架,支持结构化输出、RadixAttention前缀缓存及Agent工作流。适用于需JSON/正则约束解码、多轮对话共享上下文或追求高吞吐低延迟的场景。
需要结构化输出(JSON/正则) 构建带有重复前缀的Agent应用 多轮对话且需共享上下文 需要比vLLM更快的推理速度
12-inference-serving/sglang/SKILL.md
npx skills add Orchestra-Research/AI-Research-SKILLs --skill sglang -g -y
Dependencies: sglang torch transformers
用于在NVIDIA GPU上优化LLM推理性能,提供高吞吐和低延迟部署方案。支持量化、多卡扩展及动态批处理,适用于生产环境模型服务。
需要最大化LLM推理吞吐量 降低实时应用推理延迟 在NVIDIA GPU上部署量化模型
12-inference-serving/tensorrt-llm/SKILL.md
npx skills add Orchestra-Research/AI-Research-SKILLs --skill tensorrt-llm -g -y
Dependencies: tensorrt-llm torch

trang chủ - Wiki
Copyright © 2011-2026 iteam. Current version is 2.155.2. UTC+08:00, 2026-09-23 15:58
浙ICP备14020137号-1