中科曙光推AI推理原生存储FN Neo:Token吞吐提150%

中科曙光最近搞了个大动作,正式发布了全新迭代的AI推理原生存储FN Neo。这玩意儿可不是小打小闹,它是专门冲着提升AI推理效率去的。简单来说,就是把散落在不同计算节点里的推理缓存,统一管起来,还能共享复用。

这样一来,哪怕面对长文本或者大量用户同时访问的压力,已有的计算成果也能被榨干价值,不再浪费。 实测数据摆在这儿,效果相当炸裂。FN Neo能把模型首词出现的时间,也就是TTFT,直接砍掉73%,比传统的本地NVMe快得多。

不光是速度快,延迟表现、吞吐量还有多请求并发数,跟传统方案比都有明显提升。最核心的指标是整体Token吞吐能力,足足提高了150%。这意味着啥?就是用户等着AI回话的时间大幅缩短,系统的并发处理能力也更强了,体验感直接拉满。

当然,光跑得快还不够,还得稳。生产级的AI业务可是要7乘24小时不停歇地转,FN Neo就给了个定心丸,号称有99.999%的高可靠性。它内部还有一套多重故障防护机制,就是为了确保推理业务能一直连着跑,中间不断档。

说白了,就是给企业的AI应用上了道保险,防止关键时刻掉链子。 另外,这个产品在兼容性上也下了功夫。它支持主流的推理框架,还能适应各种复杂的组网环境。对企业来说,最大的好处就是不用对现有系统动大手术,稍微调调就能部署上去。

在原有推理生态的基础上,既能提质又能增效。这正好踩中了当下大模型和智能体规模化落地的痛点,算是给行业送来了一个实用的基础设施解决方案。

热门推荐