超100个AI药物进入临床阶段 AI制药为何仍被数据卡住

近期,一场关于AI制药的未来论坛在上海举行。众多专家聚首,聊到AI生物制药的难点,绕不开的关键词只有两个:数据。说白了,就是高质量数据,还有让数据能转起来的能力。这事儿成了全场焦点。 眼下,全球AI辅助药物研发势头很猛。

根据L.E.K. Consulting的统计,到2025年,全球进入临床阶段的AI辅助药物分子已经超过100个。同时,国内已有超过90家本土企业跟AI biotech公司搭上了伙。这数字看着挺热闹,但问题也跟着来了。

巢生资本的执行合伙人周悦欣提到,跟传统药企比,AI制药公司确实更受资本追捧。不过,热乎劲儿底下,瓶颈也挺明显。这瓶颈到底在哪儿?专家们一致认为,就在数据上。 力场采样的创始人彭向达讲得很透。他说,生物制药的模型跟搞文字的AI完全两码事。

文字模型能吃下海量网络文本,但生物分子这块儿,高质量结构数据少得可怜。分子工作规律特别复杂,一旦碰到没见过的分子,模型预测能力立马打折扣。可现实中,新药研发的对象大多是全新分子。 上海科学智能研究院的研究员杨自雄补充道,数据稀缺不光是量少。

病人用药后的反应,以前能攒下不少临床数据,但那套完整的机理数据很难看到。未来也许会有新仪器、新方法,搞出多尺度、时间维度的数据,但现在根本做不到。 所以你看,AI制药缺的不是那种泛泛的大数据,而是贴着真实研发过程走的高质量、机制性数据。

没这些底子,模型再花哨,也学不会“做药”。光难收集还不够,数据质量高低,直接决定AI制药的效果。 上海交通大学的陈洛南教授指出,跨模态的配对数据对训练AI制药模型特别重要。可惜现在行业里能拿到的,大多是单模态数据。

这就好比只看一个面,没法立体地理解问题。 临港实验室的袁博研究员给了个思路。单点数据看一个切片,容易局限在一个维度。要是能用时间扰动这类手段,拿到不同时间点的数据,就能做跨模态,输出更有条理的数据。这招听起来有戏。

说到这儿,腾讯健康的陈睿有个判断。他觉得,模型本身不是AI制药最大的拦路虎。腾讯在深科实验室做了不少蛋白质研究,很多模型都开源了,让大家随便用。他特意强调:“我们把模型权重放出来,就是心里清楚,模型不是最关键的壁垒。

” 那腾讯最近在忙啥?重点是实验反馈强化学习。陈睿说,算力和算法只是入场券。真正能破局的,是干湿实验的反馈闭环能力,还有各种数据,尤其是失败的数据。实验做完,数据得能回流到模型里接着练。这个过程中,数据处理能力和工程能力特别要紧。

他反复提醒,大家要盯紧那些失败的案例。 从这场论坛能看出来,AI制药的竞争逻辑变了。以前大家比谁的模型大、算法强、算力足。现在模型慢慢开源,算力越来越普及,真正的护城河就转向了数据生态。谁能把数据理顺、用好,谁才有胜算。

深势科技的李厦戎说了一句很有分量的话:“未来10年后,一定有一批AI重构药物研发流程的伟大公司冒出来。”这话代表了整个行业的长久期待。说白了,数据这道坎迈过去了,AI制药才能真正跑起来。

热门推荐