资料整理与质量检查
方法与说明
了解资料怎样录入、位点怎样统一编号,以及哪些实验结果可以放在一起比较。
数据流
整理后的 CSV → 自动质量检查 → SQLite 数据库 → JSON → 网页
网页和下载表来自同一套数据。
资料如何整理
- 原文记录
- 忠实记录原文表述、原始数值、原始参考样品与原文位置,不做解释与换算。
- 统一编号与名称
- 把不同论文中的编号、序列、蛋白版本和名称统一到同一套标准,同时保留原文写法。
- 查询与下载
- 在不改变原始研究资料的前提下,生成方便查询和下载的数据表;不进行人工重复录入。
怎样读懂资料等级
来源可靠度
- E1
- 同行评议论文,或完整专利实施例,方法与结果明确
- E2
- 预印本、学位论文,或专利中部分信息明确
- E3
- 综述转述、数据库摘要,或方法不完整
- E4
- 仅有计算预测,或无法定位原始研究资料
测量完整度
- M3
- 蛋白版本、参考样品、方法、数值、重复信息齐全
- M2
- 有明确方向或相对倍数,但缺部分实验细节
- M1
- 仅有“更甜/降低”等定性描述
- M0
- 无法确认存在实验测量
哪些人工品尝数据会进入标准数据表?
来源可靠度 ∈ {E1, E2}
且 测量完整度 ∈ {M2, M3}
且 变体 sequence_verified = true
且实验类型 = 人工品尝
且 model_eligibility ∈ {primary_ordinal, primary_quantitative}
实际序列、参考样品和浓度可以核对后,相应记录才会进入标准实验数据表。下载文件中的 model_eligibility 记录这项选择。
自动检查哪些内容?
更新数据时,程序会检查序列、位点编号、来源链接、单位换算和重复记录。
查看检查明细
| 检查对象 | 检查内容 |
|---|---|
| 序列与编号 | 核对原始氨基酸、突变写法和实际蛋白序列。 |
| 实验记录 | 保留蛋白版本、测量方法、参考样品、单位和来源。 |
| 重复计数 | 同一次实验的重量比和摩尔比只算一个独立观察。 |
| 专利与结构 | 核对申请状态来源、具体条款、结构类型和坐标文件。 |
实验结果不一致时怎么办?
保留每次实验的结果,并列出蛋白版本、方法和参考样品的差异,方便逐条比较。
同一位置换成不同氨基酸时,效果本来就可能不同。例如 E36D 与 E36A 是两种突变,应分别阅读。
定量观察去重
研究资料层保留论文同时报告的重量基准(w/w)和摩尔基准(molar)两行, 但它们来自同一受试者、同一实验方法和同一变体,不是两个独立观察。
observation key =
variant_id + assay_id + source_id + reference_construct_id
标准表示优先级 =
w/w → molar → study-reported basis
定量观察研究资料视图据此生成稳定 BVK-OBS-* 标识,
并通过 representation_count 保留原观察有几种数学表示。
显示规则
- 实验结果
- 实线边框标识
- 模型与计算结果
- 标明数据类型和原始出处。
- 结果不一致
- 显式标记,不取平均
- 缺失信息
- 明确显示 未报告,不显示为空白
- 原始值与统一整理后的值
- 并列展示
- 配色
- 刻意避免红/绿对比,以兼顾色觉障碍用户
已知局限
正在读取当前版本快照…