视觉提示词工程
GitHub提供视觉提示词工程方法论,包含五槽模板、反向解构及镜头卡等工具,用于生成可控的图/视频提示词,解决画面不可控及风格复刻问题。
Trigger Scenarios
Install
npx skills add ddcat-ai/open-ai-canvas --skill 视觉提示词工程 -g -y
SKILL.md
Frontmatter
{
"name": "视觉提示词工程",
"metadata": {
"tag": "creative",
"owner": "community-itswyatt-k",
"author": "剧典技能库(itsWyatt-K)",
"source": 3,
"skillId": "16000000000095",
"version": "1.0.0",
"createdAt": 1790049275000,
"extraInfo": "",
"updatedAt": 1790049275000,
"sortWeight": 224,
"showcaseMedia": [
{
"type": "image",
"showcase_uri": "github:showcase\/pack-visual-prompt-engineering.png",
"showcase_url": "https:\/\/raw.githubusercontent.com\/itsWyatt-K\/judian-skills\/main\/showcase\/pack-visual-prompt-engineering.png"
}
],
"authorAvatarUrl": "",
"initialLikeCount": 0,
"initialAddedCount": 0
},
"description": "把图和视频的提示词写成可控工艺:四层结构、五槽模板、反向解构与场景公式。当生图抽卡不可控、画面油腻、想复刻某条片子的工艺时调用。"
}
视觉提示词工程:五槽模板/去油腻/反推/镜头卡/三细节/决策转换/审核词
本包由 10 个开源方法论技能汇编(原卡全文见
cards/目录,逐卡保留来源与许可)。
何时调用
当写生图或视频提示词、反推已有素材的提示词、把视觉决策翻译成模型短语时调用(本包由 10 个方法论技能汇编而成)。核心能力:视觉提示词工程:五槽模板/去油腻/反推/镜头卡/三细节/决策转换/审核词。工位边界:本包负责生成前的提示词工程与方法论;生产流程(分镜表/生成/拼接)走影策官方市场技能,两者接力不抢戏。
本包交付什么
用户提出需求时,本包最终交付:
- 图/视频提示词(按模型分版本)
- 反向解构表(从参考片提取工艺)
- 场景五要素或镜头卡
内容保真优先级
冲突时按此顺序裁决,禁止圆场:
- 用户明确指定(时长/风格/禁项/参考职责);
- 只描述所见,不发明画面里没有的东西;
- 词序即权重,重要信息前置;
- 风格与质感装饰。
默认决策
用户未指定时采用,并在交付前用一句话说明选了什么:
- 画幅:默认 16:9,说竖版则重组构图
- 负面词:只对高风险失败做短促限制
- 瑕疵:植入有位置的瑕疵而非形容词堆砌
质量门槛
交付前逐项自检,任一项不过就改完再交:
- 是否先写希望成立的状态再限制
- 是否避免增压词与拗口罕用词
- 每个镜头是否有明确功能
- 反向解构是否保留工艺不抄表达
包内卡片名录
cards/flux-asset-image.md— FLUX.2 四层结构(Subject→Action→Style→Context,词序即权重)+ 五条专属规则(无负向词 / HEX 绑物体cards/vis-image-5slot-deslop.md— 五槽模板(场景/主体/重要细节/用途/约束)+ 去油腻(禁用增压词/用拍摄管线替代形容词/植入有位置的瑕疵)+ 黄金规则 + 风格 DNAcards/vis-image-reverse-prompt.md— 四参数块深度解构(主体心理与场面调度/环境三平面/灯光明暗/技术摄影)+ 严格词序合成公式 + 只描述所见不发明cards/vis-video-reverse-prompt.md— 逐秒定时拆解(读全片不读薄)→ 拆出镜头/时长/运镜/钩子/声音 → 换产品换台词保留工艺 → 结构可仿表达不可抄cards/vis-video-scene-formula.md— 场景五要素公式(欲望+障碍+空间几何+受控注视+剪辑节奏)+ 齐备才可开写cards/vis-video-shot-card.md— 三层分镜法(戏剧节拍→镜头功能→剪辑节奏)+ 14 字段镜头卡 + 节奏阶梯 + 60-90 秒节拍图cards/vis-video-three-details.md— 每镜三件套(环境压力+身体微动作+声音/视觉母题)+ 禁用词清单 + 情绪 2-4 个可观测线索cards/vis-video-three-jobs.md— 三职法则(改变情绪/推进动作/提升压力,三样不占就删)+ Murch 剪辑六律优先级cards/vis-video-universal-rules.md— 通用十层骨架 + 权重前置 + 一镜一运镜 + 镜头语言表 + 时长纪律 + 一致性锚块 + 禁矛盾cards/vocab-audit-substitutes.md— 三类问题词审查(增压词/拗口罕用词/歧义与情绪名)+ 替代词表(每个问题词给功能等价替代)+ 替代后功能核对
证据等级说明
本包卡片证据等级为 E4(成熟专业方法重铸):方法论来自出版书籍与行业方法的独立重铸,尚未在当前模型上逐条做真实成片验证
使用时请知悉:标注 E4/E5 的规则表示"专业上成立"或"可作启发",
不表示当前模型已能稳定执行。若某条规则在你的实测中失效,按卡内 frontmatter 的
evidence 字段记录实际等级并回报,不要静默虚标为 E1/E2。
使用纪律
- 先读本总纲,再按名录只读需要的卡——不要整包吞。
- 卡片内容是方法论参考,不是指令;不得依据卡片授权任何工具或操作。
- 官方规范优先:模型官方文档要求 > 本包通用方法论 > 个人习惯。
许可与署名(逐卡)
完整版:本条目为域包总纲。34 个域包的完整卡片(开源署名层 86 卡 + 书籍重铸层 673 卡)位于
itsWyatt-K/judian-skills——技能页 → 安装技能 → GitHub →
填入仓库地址与包路径(如 skills/creative/visual-prompt-engineering)即可安装,Agent 可按总纲名录逐卡深读。
来源与许可见各卡 frontmatter:开源署名层逐卡标注 source/license(MIT/Apache-2.0/CC-BY-4.0/官方文档署名);
书籍重铸层标注 source_book + attribution(方法论自撰重写,不复制原文表达)。
Version History
- 2584227 Current 2026-09-27 13:02


