Agent Skills › Orchestra-Research/AI-Research-SKILLs

Orchestra-Research/AI-Research-SKILLs

GitHub

基于LitGPT实现、训练及微调LLM(如Llama、Phi),支持LoRA/QLoRA高效微调,提供预训练模型加载与单文件纯净代码实现。

96 skills 11,844

Install All Skills

npx skills add Orchestra-Research/AI-Research-SKILLs --all -g -y
More Options

List skills in collection

npx skills add Orchestra-Research/AI-Research-SKILLs --list

Skills in Collection (96)

Showing top 50 of 96 by quality score. Use the install list command or open individual skills for the rest.

基于LitGPT实现、训练及微调LLM(如Llama、Phi),支持LoRA/QLoRA高效微调,提供预训练模型加载与单文件纯净代码实现。
需要快速加载并使用预训练的LLM进行推理 需要对大语言模型进行全量微调或LoRA/QLoRA高效微调 需要获取清晰的大模型架构实现用于学习或研究
01-model-architecture/litgpt/SKILL.md
npx skills add Orchestra-Research/AI-Research-SKILLs --skill implementing-llms-litgpt -g -y
Dependencies: litgpt torch transformers
介绍Mamba选择性状态空间模型架构,涵盖安装、配置及在HuggingFace加载预训练模型进行文本生成的工作流程。
需要线性复杂度序列建模 使用Mamba架构替代Transformer
01-model-architecture/mamba/SKILL.md
npx skills add Orchestra-Research/AI-Research-SKILLs --skill mamba-architecture -g -y
Dependencies: mamba-ssm torch transformers causal-conv1d
提供极简 GPT 实现,用于学习 Transformer 架构。支持从训练、采样到微调的完整流程,适用于理解模型原理及实验。
需要学习或理解 GPT/Transformer 内部机制 希望在 CPU 或小规模 GPU 上快速复现 GPT-2 或进行教学演示
01-model-architecture/nanogpt/SKILL.md
npx skills add Orchestra-Research/AI-Research-SKILLs --skill nanogpt -g -y
Dependencies: torch transformers datasets tiktoken wandb
提供RWKV架构的安装、基础用法、流式文本生成、长上下文处理及微调工作流,展示其结合Transformer训练与RNN推理的高效特性。
需要实现线性时间复杂度的序列模型 希望消除KV缓存以支持无限上下文 进行RWKV模型的训练或微调
01-model-architecture/rwkv/SKILL.md
npx skills add Orchestra-Research/AI-Research-SKILLs --skill rwkv-architecture -g -y
Dependencies: rwkv torch transformers
基于PyTorch的分布式LLM预训练工具,支持4D并行、Float8及大规模GPU集群训练。适用于Llama等模型从8到512+ GPU规模的预训练任务。
需要大规模分布式LLM预训练 配置FSDP/TP/PP并行策略 在SLURM集群上启动多节点训练
01-model-architecture/torchtitan/SKILL.md
npx skills add Orchestra-Research/AI-Research-SKILLs --skill distributed-llm-pretraining-torchtitan -g -y
Dependencies: torch>=2.6.0 torchtitan>=0.2.0 torchao>=0.5.0
提供高性能NLP分词工具,支持Rust底层加速、自定义词汇表训练及对齐追踪。适用于构建高效生产级NLP流水线或处理大规模文本数据,显著提升分词速度。
需要极速文本分词 训练自定义分词器 构建NLP数据处理管道
02-tokenization/huggingface-tokenizers/SKILL.md
npx skills add Orchestra-Research/AI-Research-SKILLs --skill huggingface-tokenizers -g -y
Dependencies: tokenizers transformers datasets
SentencePiece 是无监督语言无关分词器,支持 BPE 和 Unigram。适用于多语言、CJK 文本处理及模型训练,提供快速、轻量且确定的分词能力。
需要多语言或 CJK 文本分词 构建语言无关的 NLP 模型 需要可复现的分词结果
02-tokenization/sentencepiece/SKILL.md
npx skills add Orchestra-Research/AI-Research-SKILLs --skill sentencepiece -g -y
Dependencies: sentencepiece transformers
提供 Axolotl 大模型微调专家指导,涵盖 YAML 配置、LoRA/QLoRA、DPO/KTO 等训练策略及多模态支持,辅助用户实现高效模型训练与优化。
Axolotl 微调配置 LLM 训练调试 数据格式处理
03-fine-tuning/axolotl/SKILL.md
npx skills add Orchestra-Research/AI-Research-SKILLs --skill axolotl -g -y
Dependencies: axolotl torch transformers datasets peft accelerate deepspeed
提供 LLaMA-Factory 大模型微调的专业指导,涵盖 WebUI 无代码操作、多模型支持、QLoRA 及多模态功能,协助用户进行开发、调试与最佳实践学习。
使用 llama-factory 进行大模型微调 查询 llama-factory 功能或 API 实现 llama-factory 解决方案 调试 llama-factory 相关代码
03-fine-tuning/llama-factory/SKILL.md
npx skills add Orchestra-Research/AI-Research-SKILLs --skill llama-factory -g -y
Dependencies: llmtuner torch transformers datasets peft accelerate gradio
提供LLM参数高效微调技能,支持LoRA/QLoRA等方法。适用于显存受限下训练大模型、快速迭代多适配器及部署多变体场景,集成HuggingFace生态。
在消费级GPU上微调7B-70B大模型 需要仅训练不到1%的参数以节省内存 使用QLoRA在单卡24GB GPU上微调70B模型 需要从一个基座模型部署多个微调变体
03-fine-tuning/peft/SKILL.md
npx skills add Orchestra-Research/AI-Research-SKILLs --skill peft-fine-tuning -g -y
Dependencies: peft>=0.13.0 transformers>=4.45.0 torch>=2.0.0 bitsandbytes>=0.43.0
提供 Unsloth 快速微调大模型的专家指导,涵盖 LoRA/QLoRA 优化、API 使用及最佳实践,旨在实现 2-5 倍加速和显著降低内存占用。
使用 unsloth 进行模型微调 查询 unsloth 功能或 API 调试 unsloth 相关代码
03-fine-tuning/unsloth/SKILL.md
npx skills add Orchestra-Research/AI-Research-SKILLs --skill unsloth -g -y
Dependencies: unsloth torch transformers trl datasets peft
指导使用nnsight库进行神经网络内部解释与操作,支持本地小模型及NDIF远程执行70B+大模型。适用于PyTorch架构的激活干预、中间层访问及大规模模型推理实验。
需要在大模型上进行可解释性实验 需要远程执行超过本地GPU资源的大规模模型 需要操纵或访问PyTorch模型的内部激活值
04-mechanistic-interpretability/nnsight/SKILL.md
npx skills add Orchestra-Research/AI-Research-SKILLs --skill nnsight-remote-interpretability -g -y
Dependencies: nnsight>=0.5.0 torch>=2.0.0
指导使用 pyvene 对 PyTorch 模型执行因果干预,包括因果追踪、激活补丁和互换干预训练,用于测试模型行为的因果假设。
进行因果追踪实验 运行激活补丁分析 实施互换干预训练 验证模型组件的因果假设
04-mechanistic-interpretability/pyvene/SKILL.md
npx skills add Orchestra-Research/AI-Research-SKILLs --skill pyvene-interventions -g -y
Dependencies: pyvene>=0.1.8 torch>=2.0.0 transformers>=4.30.0
提供使用SAELens训练和分析稀疏自编码器的指导,用于将神经网络激活分解为可解释特征。适用于发现模型中的可解释概念、研究超位现象及分析单义性表示。
需要发现模型激活中的可解释特征 分析神经网络的超位现象 研究语言模型的单义性表示 进行基于特征的干预或消融实验
04-mechanistic-interpretability/saelens/SKILL.md
npx skills add Orchestra-Research/AI-Research-SKILLs --skill sparse-autoencoder-training -g -y
Dependencies: sae-lens>=6.0.0 transformer-lens>=2.0.0 torch>=2.0.0
用于Transformer可解释性研究,支持逆向工程算法、注意力模式分析及激活补丁实验。提供HookPoints和缓存接口以检查模型内部机制。
逆向工程训练学到的算法 进行激活补丁或因果追踪实验 研究注意力模式和信息流 分析电路结构如诱导头
04-mechanistic-interpretability/transformer-lens/SKILL.md
npx skills add Orchestra-Research/AI-Research-SKILLs --skill transformer-lens-interpretability -g -y
Dependencies: transformer-lens>=2.0.0 torch>=2.0.0
NVIDIA的GPU加速LLM数据整理工具,支持文本/图像等多模态数据的模糊去重、质量过滤、PII脱敏和NSFW检测。适用于清洗网页数据、构建高质量训练集及大规模语料库处理,显著提升数据处理效率并降低TCO。
准备LLM训练数据集 对大规模文本或媒体数据进行去重 清洗网络爬取数据以去除低质量或有毒内容 执行PII脱敏或NSFW检测
05-data-processing/nemo-curator/SKILL.md
npx skills add Orchestra-Research/AI-Research-SKILLs --skill nemo-curator -g -y
Dependencies: nemo-curator cudf dask rapids
Ray Data 是用于 ML 工作负载的可扩展分布式数据处理库。支持流式执行、GPU 加速及多模态数据加载,适用于大规模数据集预处理、批量推理和分布式 ETL 管道,可与 Ray Train 及主流深度学习框架无缝集成。
需要处理超过内存限制的大规模数据集 构建机器学习训练或批量推理的数据预处理流水线 需要在集群上并行加载和处理多模态数据(如图像、视频)
05-data-processing/ray-data/SKILL.md
npx skills add Orchestra-Research/AI-Research-SKILLs --skill ray-data -g -y
Dependencies: ray[data] pyarrow pandas
提供基于TRL库的GRPO强化学习微调专家指导,涵盖算法原理、奖励函数设计及数据集准备流程,用于提升模型推理能力与格式约束。
需要微调大语言模型以增强推理能力 通过自定义奖励函数强制输出特定格式 进行无偏好数据的RLHF训练
06-post-training/grpo-rl-training/SKILL.md
npx skills add Orchestra-Research/AI-Research-SKILLs --skill grpo-rl-training -g -y
Dependencies: transformers>=4.47.0 trl>=0.14.0 datasets>=3.2.0 peft>=0.14.0 torch
指导使用miles框架进行企业级大规模强化学习训练,支持MoE模型、低精度量化及推理对齐。
训练大型MoE模型 FP8/INT4量化训练 需要推理与训练严格对齐
06-post-training/miles/SKILL.md
npx skills add Orchestra-Research/AI-Research-SKILLs --skill miles-rl-training -g -y
Dependencies: sglang-router>=0.2.3 ray torch>=2.0.0 transformers>=4.40.0
基于Ray和vLLM的高性能RLHF训练框架,支持PPO、GRPO等算法,用于大模型分布式强化学习微调。
需要进行大模型的RLHF训练 执行PPO或DPO等强化学习流程
06-post-training/openrlhf/SKILL.md
npx skills add Orchestra-Research/AI-Research-SKILLs --skill openrlhf-training -g -y
Dependencies: openrlhf ray vllm torch transformers deepspeed
SimPO是一种无需参考模型的偏好优化方法,用于大语言模型对齐。它比DPO更高效、性能更好,适用于希望简化训练流程的场景。
需要为LLM进行偏好对齐 寻找比DPO更简单的训练方案 执行模型微调或训练任务
06-post-training/simpo/SKILL.md
npx skills add Orchestra-Research/AI-Research-SKILLs --skill simpo-training -g -y
Dependencies: torch transformers datasets trl accelerate
提供基于slime框架的LLM强化学习后训练指导,支持Megatron-LM与SGLang集成,适用于GLM等模型的GRPO训练、自定义数据生成及大规模RL扩展。
需要进行LLM强化学习后训练 需要结合Megatron-LM和SGLang进行分布式训练 需要实现自定义数据生成工作流 训练GLM、Qwen3或DeepSeek系列模型
06-post-training/slime/SKILL.md
npx skills add Orchestra-Research/AI-Research-SKILLs --skill slime-rl-training -g -y
Dependencies: sglang-router>=0.2.3 ray torch>=2.0.0 transformers>=4.40.0
提供基于PyTorch的Agentic RL训练指导,分离算法与基础设施。支持GRPO等算法实验及Monarch分布式扩展,适用于RL研究、模型训练及可观测性集成场景。
需要进行强化学习算法实验 需要配置分布式RL训练环境 使用torchforge库进行模型训练
06-post-training/torchforge/SKILL.md
npx skills add Orchestra-Research/AI-Research-SKILLs --skill torchforge-rl-training -g -y
Dependencies: torch>=2.9.0 torchtitan>=0.2.0 vllm monarch
基于TRL库对大语言模型进行强化学习微调,涵盖SFT指令微调、DPO偏好对齐及PPO奖励优化等RLHF流程,用于提升模型与人类偏好的一致性。
需要对LLM进行指令微调 需要利用人类反馈进行偏好对齐 需要执行完整的RLHF训练流程
06-post-training/trl-fine-tuning/SKILL.md
npx skills add Orchestra-Research/AI-Research-SKILLs --skill fine-tuning-with-trl -g -y
Dependencies: trl transformers datasets peft accelerate torch
指导使用verl库进行大规模LLM强化学习训练,支持PPO、GRPO等算法及多后端灵活切换。
实现RLHF或GRPO算法 大规模LLM后训练 配置FSDP或Megatron-LM后端
06-post-training/verl/SKILL.md
npx skills add Orchestra-Research/AI-Research-SKILLs --skill verl-rl-training -g -y
Dependencies: verl>=0.3.0 torch>=2.0.0 ray>=2.41.0 vllm>=0.8.2 transformers>=4.40.0
Constitutional AI通过自我批判和AI反馈训练无害模型,包含监督学习与强化学习两阶段。用于安全对齐、减少有害输出及构建Claude等系统的安全机制。
需要训练或微调模型以提升安全性 实现无人类标签的AI反馈强化学习(RLAIF) 使用宪法原则进行模型自我审查与修正
07-safety-alignment/constitutional-ai/SKILL.md
npx skills add Orchestra-Research/AI-Research-SKILLs --skill constitutional-ai -g -y
Dependencies: transformers torch trl
LlamaGuard 是 Meta 推出的专用内容安全分类模型,用于对 LLM 输入和输出进行过滤。支持暴力、仇恨、性内容等六大类别的安全检测,集成 NeMo Guardrails,适用于生产环境的内容审核与风险拦截。
需要检查用户提示词是否包含违规内容 需要审查 AI 生成回复的安全性 部署内容过滤中间件
07-safety-alignment/llamaguard/SKILL.md
npx skills add Orchestra-Research/AI-Research-SKILLs --skill llamaguard -g -y
Dependencies: transformers torch vllm
NVIDIA NeMo Guardrails 运行时安全框架,通过编程式护栏实现 LLM 应用的输入输出验证、越狱检测、事实核查及幻觉过滤。
LLM应用安全防护 提示注入防御 内容合规性检查
07-safety-alignment/nemo-guardrails/SKILL.md
npx skills add Orchestra-Research/AI-Research-SKILLs --skill nemo-guardrails -g -y
Dependencies: nemoguardrails
用于检测LLM应用中的提示注入和越狱攻击的安全模型,过滤恶意输入与第三方数据。
用户输入安全校验 RAG文档或API响应清洗
07-safety-alignment/prompt-guard/SKILL.md
npx skills add Orchestra-Research/AI-Research-SKILLs --skill prompt-guard -g -y
Dependencies: transformers torch
HuggingFace Accelerate 提供统一的分布式训练 API,简化 PyTorch 脚本的并行化。支持自动设备放置、混合精度及 DeepSpeed/FSDP 等后端,通过少量代码改动实现从单卡到多机多卡的无缝扩展。
需要将 PyTorch 模型扩展到多 GPU 或 TPU 训练 需要配置混合精度(FP16/BF16/FP8)以加速训练 希望统一使用一套 API 兼容多种分布式后端如 DeepSpeed 或 FSDP
08-distributed-training/accelerate/SKILL.md
npx skills add Orchestra-Research/AI-Research-SKILLs --skill huggingface-accelerate -g -y
Dependencies: accelerate torch transformers
提供 DeepSpeed 分布式训练专家指导,涵盖 ZeRO 优化、并行策略及 DeepNVMe 高性能 I/O 配置与调试。
使用 DeepSpeed 进行模型训练 咨询 DeepSpeed 特性或 API 实现 DeepSpeed 解决方案 调试 DeepSpeed 代码
08-distributed-training/deepspeed/SKILL.md
npx skills add Orchestra-Research/AI-Research-SKILLs --skill deepspeed -g -y
Dependencies: deepspeed torch transformers accelerate
基于NVIDIA Megatron-Core的大规模LLM训练技能,支持2B至462B参数模型的高效分布式训练。涵盖TP/PP/CP等多维并行策略配置、MoE训练及性能监控,适用于高GPU利用率的生产级模型训练任务。
需要训练参数量大于10亿的LLM 追求H100等高端GPU的极致计算效率 需要配置张量、流水线或专家并行策略 构建Nemotron或LLaMA等大型模型
08-distributed-training/megatron-core/SKILL.md
npx skills add Orchestra-Research/AI-Research-SKILLs --skill training-llms-megatron -g -y
Dependencies: megatron-core torch apex transformer-engine
指导 Agent 在 PyTorch 训练脚本中正确集成 FSDP2,处理模型分片、混合精度及分布式检查点,解决单卡显存不足问题。
模型超出单 GPU 显存限制 需要 DTensor 参数级分片 使用 DeviceMesh 组合数据并行与张量并行
08-distributed-training/pytorch-fsdp2/SKILL.md
npx skills add Orchestra-Research/AI-Research-SKILLs --skill pytorch-fsdp2 -g -y
Dependencies: torch
PyTorch Lightning 是高级训练框架,通过 Trainer 类简化 PyTorch 代码,自动处理分布式训练、混合精度、日志记录及检查点等复杂流程,消除样板代码。
需要简化 PyTorch 训练循环 实现自动分布式训练 配置混合精度或 GPU 加速
08-distributed-training/pytorch-lightning/SKILL.md
npx skills add Orchestra-Research/AI-Research-SKILLs --skill pytorch-lightning -g -y
Dependencies: lightning torch transformers
提供 Ray Train 分布式训练编排能力,支持 PyTorch/TensorFlow/HuggingFace 从单节点扩展至千级节点。内置超参调优、容错与弹性伸缩,适用于大规模模型训练及分布式搜索场景。
需要在多节点集群上运行大规模机器学习训练 使用 Ray Tune 进行分布式超参数优化 将现有单 GPU 代码扩展为多 GPU/多机分布式训练
08-distributed-training/ray-train/SKILL.md
npx skills add Orchestra-Research/AI-Research-SKILLs --skill ray-train -g -y
Dependencies: ray[train] torch transformers
Lambda Labs GPU云使用指南,涵盖账号配置、实例启动及SSH连接。适用于需要专用GPU进行ML训练或推理的场景,支持持久化存储与多节点集群,提供详细的价格对比与快速入门步骤。
需要租用GPU云服务器 配置ML训练环境 启动多节点GPU集群
09-infrastructure/lambda-labs/SKILL.md
npx skills add Orchestra-Research/AI-Research-SKILLs --skill lambda-labs-gpu-cloud -g -y
Dependencies: lambda-cloud-client>=1.0.0
Modal Serverless GPU 平台使用指南,支持按需GPU访问、ML模型API部署及自动扩缩容的批处理任务。
需要运行无服务器GPU的机器学习工作负载 将ML模型部署为可自动扩展的API 执行无需管理基础设施的批量数据处理或训练任务
09-infrastructure/modal/SKILL.md
npx skills add Orchestra-Research/AI-Research-SKILLs --skill modal-serverless-gpu -g -y
Dependencies: modal>=0.64.0
SkyPilot多云编排技能,用于跨云运行ML训练或批量作业,自动优化成本并利用Spot实例。
跨云运行ML训练任务 多节点分布式训练 需要自动成本优化和Spot实例容错
09-infrastructure/skypilot/SKILL.md
npx skills add Orchestra-Research/AI-Research-SKILLs --skill skypilot-multi-cloud-orchestration -g -y
Dependencies: skypilot>=0.7.0
AWQ用于大模型4-bit量化,在有限GPU内存下部署7B-70B模型,实现3倍推理加速且精度损失极小。适用于vLLM生产环境及Ampere+ GPU,优于GPTQ和bitsandbytes的精度与速度平衡。
需要4-bit量化且精度损失小于5% 在有限GPU内存上部署大型语言模型 追求比GPTQ更快的推理速度 使用vLLM进行生产级模型服务
10-optimization/awq/SKILL.md
npx skills add Orchestra-Research/AI-Research-SKILLs --skill awq-quantization -g -y
Dependencies: autoawq transformers>=4.45.0 torch>=2.0.0
用于使用bitsandbytes库将LLM量化为8-bit或4-bit,以在GPU显存受限时大幅降低内存占用并加速推理。支持INT8、NF4格式及QLoRA微调。
GPU显存不足无法加载大模型 需要部署更大规模的LLM 希望提升推理速度 进行QLoRA参数高效微调
10-optimization/bitsandbytes/SKILL.md
npx skills add Orchestra-Research/AI-Research-SKILLs --skill quantizing-models-bitsandbytes -g -y
Dependencies: bitsandbytes transformers accelerate torch
提供 Flash Attention 集成指南,通过 IO-aware 技术实现 Transformer 注意力机制的加速与显存优化。适用于长序列训练、推理加速及解决 GPU 内存瓶颈场景,支持 PyTorch SDPA 和 flash-attn 库。
Transformer 模型训练或推理速度优化 GPU 显存不足导致 OOM 处理超过 512 token 的长序列 需要降低注意力机制计算开销
10-optimization/flash-attention/SKILL.md
npx skills add Orchestra-Research/AI-Research-SKILLs --skill optimizing-attention-flash -g -y
Dependencies: flash-attn torch transformers
提供 GGUF 格式模型转换、量化及推理能力,支持 llama.cpp 在 CPU、Apple Silicon 等消费级硬件上高效运行。
需要在本地或消费级硬件部署大模型 需要对模型进行量化以优化内存和速度 使用 Apple Silicon 进行 Metal 加速推理
10-optimization/gguf/SKILL.md
npx skills add Orchestra-Research/AI-Research-SKILLs --skill gguf-quantization -g -y
Dependencies: llama-cpp-python>=0.2.0
提供LLM的GPTQ后训练4-bit量化方案,用于在消费级GPU上部署大模型,实现内存缩减与推理加速。
需要将大型语言模型量化至4位以适配有限显存 需要在保持精度前提下提升推理速度或降低显存占用
10-optimization/gptq/SKILL.md
npx skills add Orchestra-Research/AI-Research-SKILLs --skill gptq -g -y
Dependencies: auto-gptq transformers optimum peft
提供无需校准数据的LLM权重量化方案,支持1-8位精度及多种后端加速。适用于快速量化、部署vLLM/HF及LoRA微调等场景,解决无数据集时的模型压缩问题。
需要量化LLM但未提供校准数据 使用vLLM或HuggingFace部署量化模型 进行LoRA微调前的模型量化 尝试2-bit或1-bit极端量化
10-optimization/hqq/SKILL.md
npx skills add Orchestra-Research/AI-Research-SKILLs --skill hqq-quantization -g -y
Dependencies: hqq>=0.2.0 torch>=2.0.0
提供PyTorch模型训练、微调及调试的最佳实践,涵盖架构选择、优化器配置、混合精度训练及实验循环设计。
训练或微调神经网络 调试损失激增或OOM问题 选择模型架构 优化GPU吞吐量
10-optimization/ml-training-recipes/SKILL.md
npx skills add Orchestra-Research/AI-Research-SKILLs --skill ml-training-recipes -g -y
Dependencies: torch>=2.0.0
用于评估代码生成模型在多个基准测试中的表现,支持多语言及多种评测指标。
对比不同代码模型的生成能力 测试模型的多语言支持情况 测量代码生成的质量与准确率
11-evaluation/bigcode-evaluation-harness/SKILL.md
npx skills add Orchestra-Research/AI-Research-SKILLs --skill evaluating-code-models -g -y
Dependencies: bigcode-evaluation-harness transformers>=4.25.1 accelerate>=0.13.2 datasets>=2.6.1
用于评估LLM在60+学术基准上的性能,支持模型质量对比、结果报告及训练进度跟踪。兼容HuggingFace、vLLM等,适用于科研与工业界标准评测。
需要评估大语言模型在多任务理解、数学推理或代码生成等基准上的表现 比较不同模型的性能差异 追踪模型训练过程中的指标变化
11-evaluation/lm-evaluation-harness/SKILL.md
npx skills add Orchestra-Research/AI-Research-SKILLs --skill evaluating-llms-harness -g -y
Dependencies: lm-eval transformers vllm
提供纯C/C++实现的LLM推理工具,支持CPU、Apple Silicon及非NVIDIA硬件。适用于边缘部署、无CUDA环境或需简化依赖的场景,通过GGUF量化实现内存优化与加速。
在CPU或Apple Silicon设备上运行大模型 使用AMD/Intel GPU进行推理 边缘设备或嵌入式系统部署LLM 需要避免Python/Docker依赖的轻量级部署
12-inference-serving/llama-cpp/SKILL.md
npx skills add Orchestra-Research/AI-Research-SKILLs --skill llama-cpp -g -y
Dependencies: llama-cpp-python
SGLang是高性能LLM/VLM推理服务框架,支持RadixAttention前缀缓存、结构化输出及Agent工作流,提供比vLLM更快的推理速度。
需要LLM结构化JSON/正则输出 构建具有重复前缀的Agent工作流 多轮对话共享上下文需提升性能 需要快速JSON解码或前缀缓存加速
12-inference-serving/sglang/SKILL.md
npx skills add Orchestra-Research/AI-Research-SKILLs --skill sglang -g -y
Dependencies: sglang torch transformers
用于在NVIDIA GPU上优化LLM推理,实现高吞吐和低延迟。支持量化、多GPU扩展及生产部署,替代PyTorch提升性能。
需要在NVIDIA GPU上部署LLM以实现高性能推理 需要对大模型进行FP8/INT4量化以节省显存并加速 需要配置多GPU并行或集群以扩展推理能力
12-inference-serving/tensorrt-llm/SKILL.md
npx skills add Orchestra-Research/AI-Research-SKILLs --skill tensorrt-llm -g -y
Dependencies: tensorrt-llm torch

Home - Wiki
Copyright © 2011-2026 iteam. Current version is 2.155.2. UTC+08:00, 2026-08-21 03:46
浙ICP备14020137号-1 $Map of visitor$