THE DETAILS BEHIND THE DESIGN

理解 PrimeTab。

从序列规则到模型上下文,了解一次候选设计是如何完成的。

项目概览

PrimeTab 是一个面向 prime editing(先导编辑)研究的候选设计与评分工作空间。用户输入带编辑标记的目标 DNA,网站生成 pegRNA(引导先导编辑的 RNA)候选,并可调用 TabPFN 的云端接口预测编辑效率。

表格基础模型是在大量表格任务上预训练的模型。PrimeTab 把每条候选的序列、长度、碱基组成和热力学信息整理成固定特征,并把相关实验记录一同交给模型,形成当前候选的预测上下文。

当前在线范围

PE2 编辑系统、NGG 位点、单处替换 / 插入 / 删除;评分目标细胞为 HeLa。候选生成可以独立运行。

开始一次设计

  1. 在 Playground 输入目标 DNA 序列,两侧各保留至少 99 个碱基。
  2. 使用一组括号标记编辑,序列只接受 A、C、G、T。可直接载入示例体验。
  3. 选择评分模型,按需调整设计参数,然后点击“开始设计”。配置完成的模型会在生成后自动评分。
  4. 候选生成完成后即可查看和下载。评分未配置时保留候选,服务启用后可继续评分。
编辑类型写法含义
替换(A/G)A 替换为 G;多碱基替换需等长
插入(+AT)在此位置插入 AT
删除(-AT)删除此处的 AT

PBS 是引物结合区,默认长度为 7–15 个碱基。RTT 是逆转录模板,“RTT 延伸”表示编辑位置后保留的同源碱基数,默认为 3–19。长度参数支持单值、范围和逗号列表,例如 13、7-15、7,9,11。

生成与评分方法

1. 候选枚举

候选生成逻辑由原项目的 PRIDICT2 衍生生成器移植而来。在正反两条链上检查编辑附近的 NGG 位点,根据 PBS、RTT 延伸、编辑距离与编辑长度组合枚举候选,保留 spacer(靶向区)、PBS、RTT、完整 pegRNA 与克隆用序列。

2. 固定特征

每个设计计算 73 列原始特征,包括长度、碱基比例、连续同碱基片段、PAM 的变化、熔解温度和 RNA 折叠自由能。碱基类别按照固定位置编码,得到 107 维数值输入。缺失值填补和标准化使用归档 HEK293T 参考集的参数。

3. 为每条候选选择上下文

评分沿用归档的 HeLa 局部参考策略:每条候选选择 16 条 HeLa 实测记录,并加入 984 条 HEK293T 记录,共 1,000 条。HEK293T 部分包含标签分层样本、候选近邻,以及与 HeLa 参考样本相关的近邻。当前任务中的相同靶位点会从两类参考数据中排除。

服务器用 CPU 完成特征计算与参考检索,将选定的数值特征和标签发送到模型服务。每条候选拥有独立上下文。云端调用进度按已得到有效返回的候选数量更新。

4. 保存可追溯结果

候选编号、设计参数、模型名称、运行时间、上下文策略、预测尺度及原始分数写入导出文件。网站后台保存逐候选检索摘要与服务调用检查点,支持中断后继续处理。

模型与接口

模型接入方式启用条件
TabPFNPrior Labs 官方 Python 客户端服务器配置 API 密钥及参考数据
LimiX2Coming soon后续开放

Playground 会显示每个服务的当前配置状态。API 密钥保存在服务器,不下发给浏览器。供应商的额度、排队情况和网络状态会影响评分时间。每条候选采用独立上下文,默认示例产生 612 条候选,完整云端评分可能需要数小时。

在线接口由供应商提供模型推理。历史研究使用固定版本的本地 TabPFN 权重,在线服务的结果需针对实际接口版本重新验证。LimiX2 计划在后续版本开放。

理解结果

预测效率按百分比显示,CSV 同时保留原始小数值与百分比。原始输出不截断,少量预测可能超出 0–100% 范围。排序用于比较当前任务中的候选;当前流程没有估计经过校准的置信区间。

候选表包含 spacer、PBS、RTT 和完整 pegRNA。表格内的序列采用 DNA 字母表示,方便克隆设计与原项目文件互通。结果中的候选顺序可以按预测分数或长度查看。

“导出候选”包含生成阶段的完整设计和特征;“导出评分”包含评分与排名;“运行记录”包含参数和方法信息。

任务与历史

首次访问 Playground 时,网站通过必要 Cookie 识别当前浏览器。无需注册或登录。任务、结果和进度保存于服务器;刷新页面会回到正在运行的任务,多标签页会看到相同进度。

同一浏览器身份同时允许一项运行中的任务。重复点击与网络重试会复用同一个提交编号。断网期间服务器继续计算,恢复连接后网页自动查询最新状态。

在“历史记录”中可以搜索和打开过去的任务。在“找回记录”中生成并妥善保存恢复码,之后可在另一设备输入恢复码重新访问记录。恢复码相当于访问凭证。生成新恢复码后,旧恢复码失效;已经登录该匿名身份的浏览器会话继续有效。

清理 Cookie、使用隐私窗口或更换浏览器会创建新的身份。没有保存恢复码的旧记录无法由新身份访问。匿名方式按浏览器身份限制任务,无法保证同一自然人只拥有一个身份。

取消操作会停止本站的后续处理。已经提交给供应商的推理可能仍会完成。遇到结果不明确的提交,系统会暂停重复发送,保留检查点供核对。

数据与隐私

网站与任务数据库部署于德国服务器。本站保存用户提交的序列、设计参数、生成候选、任务状态与结果,用于任务恢复和历史查询。必要 Cookie 保存随机会话标识,有效期一年;网站不使用广告或行为分析脚本。

选择云端评分后,候选的数值特征、选定参考记录及实验标签会发送至所选模型供应商。候选生成阶段在本站服务器完成。服务的存储位置与数据处理方式以供应商说明为准。

当前历史记录保留至运维清理,尚未提供自动到期删除或自助删除。请下载需要长期保存的结果。任务接口逐项检查归属,猜测任务编号无法读取其他访客的数据。

范围与限制

  • 每次一处编辑;输入最长 10,000 个字符。
  • PBS 与 RTT 长度参数为 1–100,组合最多 256 种;每项任务最多生成 5,000 条候选。
  • 默认每个浏览器身份每天最多创建 30 项任务,每个身份 24 小时内最多完成 2,000 条云端预测,并有站点队列和访问频率限制。
  • 参考细胞背景、编辑系统、试验条件和输入分布会影响预测适用性。
  • 网络暂时中断可以恢复;浏览器须允许必要 Cookie 和 JavaScript。

来源与实现

在线实现:2026 年 10 月。项目代码保留第三方来源和许可说明。