跳转至

合成数据人工抽查记录

本轮扩容后,在生成数据门禁通过的基础上,按 16 个 kind、10 个文章体裁和 9 个代码语言分层抽查了 trainevalboundary 三个 split 的首条样本(共 48 条)。抽查重点是:

  1. 中文自然语言直引号是否确实改成 “”/‘’
  2. 英文原文、JSON、路径、标识符和字符串字面量是否逐字保留;
  3. Python、JavaScript、Java、Go、Rust、SQL、Shell、YAML 的注释语法是否正确,代码行是否发生非目标变化;
  4. 体裁标签、语言标签和案例编号是否与 prompt/target 一致。

抽查结论:48/48 条样本的标注意图清晰,未发现模板变量残留、代码围栏缺失或非注释代码行漂移;机器门禁结果保存在 quality_audit.json。该抽查是合成数据质量证据,不等价于真实用户反馈覆盖,后续仍需扩大语言版本和人工复核比例。