128G内存扛不住35B模型?90分钟烧坏一根,9天后第二根告急

最近有位海外网友分享了个惨痛教训。他在家里的老工作站上跑35B参数的大模型,结果才用了90分钟,一根内存条就直接报废了。更糟的是,过了八九天,第二根也开始报错。这事儿发生在9月30日,网友名叫Future_Fuel_8425,他用的是一台2019年的ThinkStation P920。

这台机器配置不低,双路至强处理器,配上128GB的DDR4 ECC内存,一共16根8GB的条子。显卡方面,用的是RTX 5070 Ti 16GB版本。 说白了,之前这机器一直很稳。过去半年里,这位网友一直在跑20B以下的小模型。

那时候模型能完全塞进显存里,就算长时间高负载运转,也没出过任何岔子。直到这次,因为数据库任务的需求,他不得不换上更大的35B模型,也就是Ornith-1.5-35B-A3B。这一换,麻烦来了。模型太大,显存放不下,一部分只能溢出来,挤到了系统内存里。

结果就是,跑了仅仅90分钟,系统直接崩了。查看日志发现,第8插槽的内存条ECC错误疯狂堆积。他把这根内存条拔下来之后,系统又恢复正常了。 本以为换了根新的就能安心干活,没想到好日子没过几天。继续高强度使用八九天后,日志再次报警,提示另一根内存条也快撑不住了。

这位网友特别强调,温度绝对不是罪魁祸首。他说CPU从来没超过80摄氏度,GPU也很少突破65度。而且他还专门加了辅助散热设备,所有内存条都是同一批次的匹配条。他自己猜测,可能只是这些内存条老化太严重,实在扛不住这种长时间、高强度的连续读取压力。

不过话说回来,这位网友只晒出了CPU和GPU的温度数据,唯独没提内存本身的温度。这就有点耐人寻味了。DDR4内存的老化问题,加上长时间连续的顺序读取高负载,再考虑到内存条自身的散热条件其实挺有限的,这几个因素叠在一起,很可能才是导致内存损坏的真正元凶。

毕竟,内存条要是长期在过热状态下工作,寿命缩短那是必然的。

热门推荐