/help/
帮助与教程 内测中
十分钟走完一次分子设计;不会写 SMILES 也能开始。
十分钟走完一次分子设计
主线:EGFR 激酶与它的抑制剂。每一步的按钮都载入真实示例;每步的状态词与能力表同源生成;非“内测中”的步骤还没开放,只说明将来会在哪一步做什么。
- 靶点内测中
从基因名 EGFR 出发确认蛋白(UniProt P00533),查看共晶结构 1M17 里坐着的抑制剂。本步需要联网查询公共数据库。
在本页打开 EGFR(P00533)需先打开右上角「联网查询」开关;数据直连 UniProt 与 RCSB PDB,只发送检索词。断网时页面会明确提示,1M17 示例结构可离线查看。
- 苗头:以厄洛替尼为查询找相似内测中
1M17 的共晶配体就是厄洛替尼。在示例库里按 Morgan 指纹找像它的化合物,吉非替尼会排在前面。
在本页打开 - 苗头:虚拟筛选漏斗内测中
把 68 个示例化合物依次过 Lipinski、PAINS 排除、QED ≥ 0.5 三层,看每层淘汰了多少。
在本页打开 - 优化:R 基枚举内测中
围绕一个核心骨架换取代基做类似物,再用 matched pair、SAR 表与 MPO 雷达比较;全部在本机 RDKit.js 计算,已与 Python RDKit 对拍。
去优化页 - 评估:伊马替尼的 QED 与结构警示内测中
看八项子分哪几项拉低了总分,雷达上哪条轴超限,有没有 PAINS/Brenk 命中;点“加入分子集”存进项目。
在本页打开 - 交付:导出报告内测中
把分子集导出成单文件 HTML 报告(带方法与数据来源节)、CSV 或 SDF。
在本页打开
靶点页实操:从一个基因名到一个可用的查询分子
靶点页做一件事:把蛋白和它的结构找出来,再把结构里已经坐着的共晶配体交给苗头检索。它不识别口袋,也不做对接。下面按页面上的控件顺序走一遍。
- 先决定联不联网
右上角的「联网查询」开关默认是关的,这时 检索 按钮置灰,本页不发出任何网络请求。打开后浏览器直连 UniProt、RCSB PDB 与 AlphaFold DB,只发送你输入的检索词。不想联网也能往下走,见第 5 步。
- 填检索词,选物种
输入框接受三种写法:基因名(EGFR)、UniProt 号(P00533)、PDB 号(1M17)。物种下拉有人、小鼠、大鼠、拟南芥、水稻;别的物种选“其他”再填 taxonomy id。点 检索。查不到会明确显示“未找到”,不会给一张猜出来的卡片。
用 EGFR(P00533)试一次 - 读靶点卡,挑一个结构
靶点卡下面是结构列表:实验结构带分辨率、年份与共晶配体,预测结构带平均 pLDDT。要给后面的相似性检索找起点,就挑带共晶配体的实验结构;同一个蛋白有多个时,分辨率数值小的更清楚。点中的结构显示在右侧查看器里,拖动旋转,滚轮缩放。
- 把共晶配体交给苗头检索
查看器下方列出这个结构里的配体。在配体上点 以此为查询做相似性,页面跳到苗头页,查询分子已经填好,直接在示例库里按指纹找相似。
- 不联网的两条路
点 离线查看内置示例 1M17:这是 RCSB 原始文件的离线副本,说明里写着下载日期,配体列表里的 AQ4 就是厄洛替尼。或者点 上传本地 PDB/mmCIF,文件只在浏览器里读取;不是结构文件会报“无法识别”。
打开靶点页 - 这一页到哪为止
口袋自动识别还没有提供,页面高亮的只是结构文件里已有的配体;对接打分不在这一页,也还没有开放。要对自己的靶点做口袋分析与对接,属于定制计算,见 关于与联系。
SMILES 速成(点即算)
常见问题
- 为什么不能在页面上画结构?
- 结构绘制编辑器(Ketcher,Apache-2.0)还在评估自托管体积与集成成本,状态为规划中。现在请输入 SMILES 或内置库名称。
- 我的分子会上传吗?
- 不会。本平台是纯静态网站,没有服务端、没有账号、没有管理后台;分子与项目只存在你这台电脑的浏览器里,我们看不到任何用户分子。
- 雷达图超限是不是就不能用?
- 不是。Lipinski 等规则描述的是口服药的统计分布,许多天然产物与注射药超出规则仍是好药;超限提示的是需要额外关注的性质。
- QED 怎么解释?
- QED 把八项性质各自映射到 0–1 的“期望度”,再取加权几何平均(Bickerton 2012)。它反映与上市口服药分布的接近程度,不代表活性、毒性或可合成性。
- 为什么有些模块是“规划中”?
- 它们需要服务端算力、外部数据或训练好的模型。达成条件写在各模块页上,达成前不提供任何结果,也不放演示结果。
术语表
- SMILES
- 用一行字符描述分子结构的线性记法。
- SMARTS
- 描述子结构模式的记法,用于子结构检索与警示规则。
- 分子指纹
- 把结构编码成比特串,用于快速比较相似度。
- Morgan 指纹
- 按每个原子周围一定半径的环境编码的圆形指纹,半径 2 相当于 ECFP4。
- Tanimoto 系数
- 两个指纹共同置位数除以任一置位数,0 到 1,越大越相似。
- 靶点
- 药物作用的生物大分子,通常是蛋白。
- 苗头化合物
- 对靶点显示初步活性、值得跟进的化合物。
- 先导化合物
- 经过初步优化、活性与性质较均衡、进入系统优化的化合物。
- 虚拟筛选
- 用计算规则或模型从大量候选中缩小范围。
- Lipinski 五规则
- 分子量 ≤500、cLogP ≤5、氢键供体 ≤5、受体 ≤10;违反多于一条时口服吸收较差的可能性增大。
- Veber 规则
- 可旋转键 ≤10 且极性表面积 ≤140 Ų,与口服生物利用度相关。
- cLogP
- 计算的油水分配系数对数,衡量亲脂性(本平台用 Crippen 方法)。
- TPSA
- 拓扑极性表面积,与膜通透性相关。
- QED
- 类药性定量估计,八项性质期望度的加权几何平均。
- PAINS
- 泛测定干扰化合物子结构,易在多种测定中产生假阳性。
- Brenk 警示
- 含不稳定、反应性或毒性风险的子结构清单。
- ADMET
- 吸收、分布、代谢、排泄与毒性。
- R 基
- 核心骨架上可变的取代位点及其取代基。
- Matched molecular pair
- 只在一处发生结构变换的一对分子,用来看单一变换对性质的影响。
- SAR
- 构效关系,结构变化与活性变化之间的关系。
- MPO
- 多参数优化,把多项性质按期望区间与权重合成总分。
- 分子对接
- 预测小分子在蛋白口袋中结合姿势并打分的计算方法,打分不等于实测亲和力。
- 逆合成
- 从目标分子倒推可能的合成路线。
- InChIKey
- 由 InChI 哈希得到的 27 字符定长标识,便于检索。