把 AI 分子设计,落到真实的酶与药物问题上
四块相互咬合的能力:从结构预测出发,贯通序列设计、进化决策与知识沉淀。
酶工程 AI 设计
结构预测 → 骨架设计 → 序列设计 → 突变位点 → 动力学验证的全自动工作流。
结构预测与 MSA
AlphaFold 系模型的本地化部署与深度优化,摆脱外部服务依赖。
计算药物设计
分子对接、亲和力预测与虚拟筛选:从靶点到候选分子的计算环节。
数据与知识工程
文献自动采集、OCR 与向量化检索,把领域知识沉淀为可引用系统。
精选工作 / 数据可追溯,详情陆续成文
本地化 MSA 搜索管道:把"外部服务"搬进自有算力
mmseqs2 版本选型、300 GB 预建索引、db-load-mode 2 与 max-seqs 截断的联合调优;单酶 MSA 稳定 1–3 分钟,质量超公共服务器基线。
虚拟水解酶库的构建与清洗
从 Swiss-Prot 全库筛选虚拟水解酶,修正磷脂酶误匹配、序列碎片与长度异常三类污染,获得可用于大规模建模的安全数据集。
"计算-实验"闭环驱动的酶定向进化(M2 → M4)
ESM-2 零样本打分 + 口袋检测驱动迭代决策;gate 判断以数据为准而非预设候选池,全程断点续跑、日志可审计,突变体经实验表征验证。
含辅因子配体的全长建模与序列重设计
NAD / PLP / FAD 等辅因子配体的白名单化处理规则;在真实酶系上完成全长建模与序列重设计,建模—设计—归档全流程标准化。
研究笔记 / 整理中,陆续上线
Protenix 本地化 MSA 部署全记录:索引、内存与 10 倍提速
从"外部服务器 40 分钟卡死"到"本地 2 分钟出结果"的完整调优日志。
ESM-2 零样本突变预测:从打分到实验验证的距离
7A 口袋检测圈定热点,哪些突变值得进实验室的判断依据。
虚拟酶库清洗实录:一次 SQL 通配符引发的"磷脂酶混入"事故
LIKE 下划线通配符如何误伤 1042 条序列,教训与规则全公开。
配体建模的坑:CCD 编码、白名单与固定化学计量
辅因子配体建模中那些文档不会告诉你的规则。
作者简介
Boris
我是一名独立研究工程师,专注把 AI 分子设计方法落到真实的酶工程与药物发现问题上。从零搭建了覆盖结构预测、序列设计、定向进化到分子对接的自动化计算管线,也亲手处理过从 MSA 数据库到知识库工程的各类"脏活"。
酶与药,分子设计一以贯之——一个设计逻辑,既能改造酶,也能设计分子。
- 结构预测·Protenix / Boltz / 本地化 MSA(mmseqs2)
- 序列与骨架·ProteinMPNN / RFdiffusion
- 突变分析·ESM-2 零样本 + 口袋检测
- 对接与动力学·Glide / MM-GBSA / GROMACS
- 数据工程·PostgreSQL + pgvector / RAG
- 自动化·批量编排 · GPU 集群调度 · 断点续跑