
transcript
show notes
9月23日,做人工智能的公司 Anthropic 宣布了一件事:它的大型语言模型 Claude 找到了一种酶系统,性质让人想到 CRISPR。CRISPR 是拿过诺贝尔奖的基因编辑工具,常被叫作“基因剪刀”。消息一出,科学界有人点赞,也有人皱眉。这也是 Anthropic 今年早些时候成立的研究小组公布的第一项发现。
Anthropic 还建立了一个湿实验室,也就是做真实生物实验的实验室,用来研究药物发现。公司明确表示,这次发现不是他们工作的终点。
小标题:21.5小时,950个AI“小助手”
Anthropic 说,大约950个 Claude 智能体同时工作,只用了21.5小时,就在大量基因数据里找到了“有意思”的序列。加州大学伯克利分校的基因编辑专家 Fyodor Urnov 说,他真诚地称赞 Anthropic 把发现告诉世界。他所在的创新基因组学研究所(IGI)和 Anthropic 有合作,但没有参与这次发现。
不过,并不是所有科学家都同样热情。斯坦福大学的 Le Cong 教授研究怎样把 AI 用到基因组工程里。他说:“实验还在排队,公关已经上线。”意思是,真正证明这个发现的关键实验还没完成,宣传已经先开始了。
小标题:AI 找到的到底是什么?
Anthropic 让 Claude 在巨大的基因组数据库里寻找“有趣的新例子”,目标是一类叫逆转录酶的蛋白质。逆转录酶会把 RNA 复制成 DNA。我们细胞里通常是 DNA 变成 RNA,但有些生物会用逆转录酶做别的事,比如把一段 DNA 插进别的地方。
Claude 智能体一开始找出20多万个可能的逆转录酶。它们从中挑出几千个看起来是新的,再继续缩小范围,最后找到一个“不寻常”的逆转录酶家族。这个家族里有一段很长的重复 DNA 序列,看起来像 CRISPR 的重复序列。Anthropic 把它叫作 ART,意思是“阵列相关逆转录酶”。这个系统存在于巨型噬菌体里,也就是感染细菌的大型病毒。
一个 AI 智能体在报告里写道:“我用眼睛就能看到一个串联重复阵列……那是像 CRISPR 一样的……重复阵列?!”不过,技术报告也承认,这个系统可能是逆转录子(retron)。CRISPR 和逆转录子都是细菌的免疫系统,逆转录子在基因编辑里有一些用途,但它不是 CRISPR 那样的“多面手”。所以,Anthropic 的博客把重点放在“像 CRISPR”上,让一些科学家觉得有点夸大了。
小标题:闪亮的,是玻璃还是钻石?
Le Cong 打了一个比方:假设我们在圣莫尼卡海滩,想从所有沙子里找一颗钻石。AI 找到了一个很闪的东西,但你还得回实验室,才能知道它是玻璃还是钻石。
如果你在海滩上捡到一个亮晶晶的东西,你会怎么判断它是玻璃还是钻石?要回答这个问题,就需要做实验、比较证据,而不是只看它闪不闪。
这也是为什么很多问题还没有答案。这个酶系统能不能当基因编辑工具?如果能,它好不好用?这些都不知道。Anthropic 的技术报告里只包含一个实际实验,而且报告还没有经过同行评审。同行评审就是让其他专家先检查研究,再决定能不能发表。
Anthropic 说,他们还不明白这个系统到底做什么,但只有少数已知系统有它的特征,而那些系统都能剪切、复制和粘贴 DNA。
小标题:是AI独立发现的吗?
格莱斯顿研究所的 Seth Shipman 说,他不认为 Anthropic 找到的是一个新 CRISPR 系统,但这个发现仍然有趣。“真正新的是他们怎么找到的,不是它是什么。”他的实验室曾用逆转录子来做基因编辑系统,所以用逆转录子做工具是可能的。
Shipman 还说,用人工方式在基因组数据库里找新的逆转录酶,可能要花好几个月;Anthropic 一天就做到,确实让人印象深刻。但他提醒,不要把发现完全归功于 AI 模型,因为研究里还有科学家参与。
如果电脑先找到线索,科学家还需要做实验吗?Shipman 的提醒是:需要,因为科学发现最后要在现实世界里验证。
而且,同一个逆转录酶其实早就在2021年被得克萨斯 A&M 大学的微生物学家 Jason Gill 和同事在一篇关于巨型噬菌体的论文中识别过。可能更新的部分是:Claude 识别出它周围的重复序列,暗示这个酶可能属于一个像 CRISPR 的系统。Gill 说,这些模型很会找模式,比人用眼睛盯着看更强;但人也做得到,只是人通常需要先有一个假设。他还说,ART 似乎和任何已知 CRISPR 系统没有明显关系,Anthropic 需要证明它真的有基因编辑活性。
Le Cong 也认为,科学家们为 Claude 找到了很适合它的问题,因为模型擅长找模式。它可能被用于类似的大数据项目,但这不代表 Claude 会突然加速生命科学里的所有发现。
小标题:不透明的地方
这次发现还有一个争议:科学界无法评估 Claude 到底是用什么信息训练出来的。现在很多重要期刊要求科学家公开代码,方便别人重复实验。但 Anthropic 的模型训练数据不公开,让这项发现显得不太透明。
有一位研究这些酶的科学家甚至怀疑,模型可能训练过他尚未发表的研究,因为他曾把未发表的结果分享给公开版 Claude。Anthropic 对《纽约时报》说,Claude 没有在任何用户对话记录上训练,他们的分子生物学团队也没有这样的访问权限。
就算 Claude 真的找到了下一个基因编辑大发现,也仍然需要人类科学家在实验室里测试这个假设,才能证明它。Anthropic 的 CEO Dario Amodei 在 X 上写到,未来也许可以让 Claude 自己安全地控制实验室设备做实验。但他也说,即使这可能,也是很远的未来。这样的想法会带来很多安全和监管问题。他还补充说,Anthropic 的实验室处在最低生物安全级别,所以里面没有对人类特别有害的东西。
小标题:从发现到药物,为什么那么久?
CRISPR 的故事可以告诉我们答案。1987年,科学家第一次在细菌里发现 CRISPR 序列。25年后,也就是2012年,Jennifer Doudna 和 Emmanuelle Charpentier 才证明它可以被编程,用来切割 DNA。今天 CRISPR 已经在实验室里广泛使用,也在几十个临床试验里被测试,用来治疗心血管病、癌症、自身免疫病和罕见病。但到2023年底,只有一种使用这种技术的药物上市。
一个发现从实验室到药物,为什么可能要很多年?CRISPR 的经历说明,一个有希望的基础科学发现,要变成真正的药物,路很长。
小标题:AI 能不知道要找什么,就找到重要东西吗?
Anthropic 的发现还指向一个更大的问题。CRISPR 之所以具有革命性,是因为科学家发现了一个以前完全未知的生物系统。那 AI 能不能在不知道自己要找什么的情况下,发现真正有用的东西?这还有待观察。
Le Cong 说,如果一个 AI 只训练于人们发现 CRISPR 之前的知识,然后它自己发现了 CRISPR,那可能才是更好的测试 AI 科学家的方法。
所以,这次 Anthropic 的宣布更像是一个开场,而不是终点。AI 可能帮科学家更快找到线索,但要把“闪亮的东西”变成真正的工具和药物,还需要很多人类实验、时间和验证。