资料整理与质量检查

方法与说明

了解资料怎样录入、位点怎样统一编号,以及哪些实验结果可以放在一起比较。

来源与实验信息分开评价序列可核对冲突明确保留

数据流

整理后的 CSV → 自动质量检查 → SQLite 数据库 → JSON → 网页 网页和下载表来自同一套数据。

资料如何整理

原文记录
忠实记录原文表述、原始数值、原始参考样品与原文位置,不做解释与换算。
统一编号与名称
把不同论文中的编号、序列、蛋白版本和名称统一到同一套标准,同时保留原文写法。
查询与下载
在不改变原始研究资料的前提下,生成方便查询和下载的数据表;不进行人工重复录入。

怎样读懂资料等级

来源可靠度

E1
同行评议论文,或完整专利实施例,方法与结果明确
E2
预印本、学位论文,或专利中部分信息明确
E3
综述转述、数据库摘要,或方法不完整
E4
仅有计算预测,或无法定位原始研究资料

测量完整度

M3
蛋白版本、参考样品、方法、数值、重复信息齐全
M2
有明确方向或相对倍数,但缺部分实验细节
M1
仅有“更甜/降低”等定性描述
M0
无法确认存在实验测量

哪些人工品尝数据会进入标准数据表?

来源可靠度 ∈ {E1, E2} 且 测量完整度 ∈ {M2, M3} 且 变体 sequence_verified = true 且实验类型 = 人工品尝 且 model_eligibility ∈ {primary_ordinal, primary_quantitative}

实际序列、参考样品和浓度可以核对后,相应记录才会进入标准实验数据表。下载文件中的 model_eligibility 记录这项选择。

自动检查哪些内容?

更新数据时,程序会检查序列、位点编号、来源链接、单位换算和重复记录。

查看检查明细
检查对象检查内容
序列与编号核对原始氨基酸、突变写法和实际蛋白序列。
实验记录保留蛋白版本、测量方法、参考样品、单位和来源。
重复计数同一次实验的重量比和摩尔比只算一个独立观察。
专利与结构核对申请状态来源、具体条款、结构类型和坐标文件。

实验结果不一致时怎么办?

保留每次实验的结果,并列出蛋白版本、方法和参考样品的差异,方便逐条比较。

同一位置换成不同氨基酸时,效果本来就可能不同。例如 E36D 与 E36A 是两种突变,应分别阅读。

定量观察去重

研究资料层保留论文同时报告的重量基准(w/w)和摩尔基准(molar)两行, 但它们来自同一受试者、同一实验方法和同一变体,不是两个独立观察。

observation key = variant_id + assay_id + source_id + reference_construct_id 标准表示优先级 = w/w → molar → study-reported basis

定量观察研究资料视图据此生成稳定 BVK-OBS-* 标识, 并通过 representation_count 保留原观察有几种数学表示。

显示规则

实验结果
实线边框标识
模型与计算结果
标明数据类型和原始出处。
结果不一致
显式标记,不取平均
缺失信息
明确显示 未报告,不显示为空白
原始值与统一整理后的值
并列展示
配色
刻意避免红/绿对比,以兼顾色觉障碍用户

已知局限

正在读取当前版本快照…