jcrd-experiments
GitHub专为《计算机研究与发展》稿件设计的实验技能,指导RQ匹配、基线公平性、统计显著性、消融分析及防污染等规范,确保实验充分可复现,通过双盲外审。
Trigger Scenarios
Install
npx skills add brycewang-stanford/Awesome-Journal-Skills --skill jcrd-experiments -g -y
SKILL.md
Frontmatter
{
"name": "jcrd-experiments",
"description": "在为《计算机研究与发展》(Journal of Computer Research and Development, JCRD) 稿件设计与呈现实验时调用。覆盖研究问题到证据的匹配、公开数据集与真实系统的选择、可信基线与公平对比、评价指标与统计显著性、消融与敏感性分析、真实平台的性能能效度量、大模型\/挖掘类研究的防污染与来源钉死、以及图表与结果呈现规范。适用于把一份计算机学科的中文稿件的实验部分做到能经受本刊双盲外审审视、证据充分且可复现的场景。"
}
《计算机研究与发展》实验设计与呈现 (JCRD Experiments)
本技能帮助为《计算机研究与发展》(Journal of Computer Research and Development, JCRD) 稿件设计与 呈现实验。JCRD 走双盲多轮同行评审,外审专家审视实验的充分性、公平性与可复现性。原则 一句话:让证据匹配论断的形态——你声称什么,就用相应证据支撑什么,不多不少。
一、研究问题到证据
- 先把贡献拆成可检验的研究问题 (RQ),每个 RQ 对应一组实验与一个结论。
- 每个论断都要有证据;反之,每组实验都要服务某个论断,避免「为做而做」的堆砌。
二、数据集与真实系统
- 优先公开数据集(利于复现与对比);自建数据给构建/清洗脚本与统计描述。
- 系统类工作用真实平台或可信模拟器,说明配置与负载。
- 记录数据集版本与抽取日期(见
jcrd-reproducibility)。
三、基线与公平对比
- 选有代表性、够强的基线(含最新工作),避免只比弱基线。
- 同口径对比:同数据划分、同评测协议、同资源预算;复现基线时说明来源与超参。
- 若无法完全公平,明确说明差异并讨论其影响。
四、指标与统计显著性
- 指标定义清晰、与基线一致;分类/回归/系统各用恰当指标。
- 多次运行报告均值±标准差,做显著性检验(如配对检验),避免单次好结果。
- 报告效应量与置信区间时说明口径;系统度量给测量方法(预热、重复、取值)。
五、消融与敏感性
- 消融实验逐一去掉关键部件,量化各自贡献,支撑「哪个设计有效」。
- 敏感性分析:关键超参/规模/数据量变化下的稳健性。
- 失败案例分析:给出方法失效的场景,增强可信度。
六、真实平台度量(系统类)
- 报告吞吐/延迟/扩展性/能效时给硬件、并发、负载与测量方法。
- 扩展性给曲线(随规模/节点变化),说明瓶颈。
- 与工业/学术基线同环境对比。
七、大模型与挖掘类研究
- 防污染:核查评测集是否被训练数据污染,说明检查方式。
- 来源钉死:记录模型标识与日期、温度等参数,缓存原始输出(见
jcrd-reproducibility)。 - 挖掘研究记录仓库/数据版本 SHA、抽取日期、清洗规则。
八、结果呈现规范
- 表格用三线表,最优值加粗,给单位与口径;图给轴标与图例(见
jcrd-writing-style)。 - 结果先给结论再给数据:一句话论断 + 支撑表/图。
- 大表放补充材料,正文给关键摘要(见
jcrd-supplementary)。
九、常见退修点与修法
| 退修点 | 修法 |
|---|---|
| 基线太弱/过时 | 补最新强基线,同口径对比 |
| 只单次结果 | 多次运行 + 显著性检验 |
| 缺消融 | 补部件消融,量化各自贡献 |
| 对比不公平 | 统一数据划分与评测协议,说明差异 |
| 大模型可能污染 | 加污染检查与说明 |
| 结果不可复现 | 提供匿名材料与来源钉死,见 jcrd-reproducibility |
十、按方向的实验侧重
《计算机研究与发展》(Journal of Computer Research and Development, JCRD) 覆盖多个方向,不同方向的 实验侧重不同,投对口专题时尤其要贴合专题期望:
| 方向 | 实验侧重 | 常见外审关注 |
|---|---|---|
| 体系结构 | 真实平台/模拟器、性能能效权衡、扩展性 | 基线平台是否公平、能效测量口径 |
| 人工智能 | 公开数据集、强基线、显著性、消融 | 数据划分、污染、单次结果 |
| 网络与信息安全 | 威胁模型、攻防实测、开销评估 | 安全性论证是否严谨、实验代表性 |
| 大数据/系统 | 真实工作负载、吞吐延迟、可扩展性曲线 | 规模是否真实、瓶颈分析 |
| 软件技术 | 真实项目/缺陷集、可用性、案例研究 | 主体系统选取、外部效度 |
十一、结果可信度自问
- 若换一个随机种子,结论还成立吗?(多次运行 + 显著性)
- 若审稿人复现,能拿到同样的数字吗?(见
jcrd-reproducibility) - 最强基线是否真的最强,还是回避了更强对手?
- 增益是否来自方法本身,还是超参调优或数据泄露?
- 失败案例是否被诚实报告,还是被悄悄隐去?
对以上任一问题回答「不确定」,都应在投稿前补足证据,否则易在双盲外审中被质疑。
十二、检查清单
- 每个论断有对应实验,每组实验服务某 RQ。
- 公开数据集/真实系统,版本与日期记录。
- 基线强且同口径,显著性检验到位。
- 消融与敏感性分析完整。
- 系统度量给硬件/负载/测量方法。
- 大模型/挖掘研究防污染 + 来源钉死。
- 结果呈现规范,先结论后数据。
小结
实验是《计算机研究与发展》(Journal of Computer Research and Development, JCRD) 双盲外审的重点 审视对象。让证据匹配论断、基线足够强且同口径、结果多次运行并做显著性、消融量化各部件贡献、大 模型与挖掘研究钉死来源并防污染——做到这些,实验部分才能经受外审并支撑复现。投对口专题时还应 贴合专题方向的实验侧重(体系结构重能效、系统重可扩展性、AI 重消融与污染检查)。
输出格式
[JCRD 实验] 充分 / 待补
[RQ→证据] 每个论断有对应实验?
[数据/系统] 公开数据集/真实平台 + 版本日期?
[基线] 强 + 同口径?
[统计] 多次 + 显著性?
[消融/敏感性] 完整?
[大模型/挖掘] 防污染 + 来源钉死?
[呈现] 三线表/轴标/先结论后数据?
Version History
- 9f86f09 Current 2026-07-19 16:16


