靠2400行C代码:25GB内存跑通7440亿参数GLM-5.2!就是速度太感人
最新7月13日消息,近日一位独立开发者打造了名为Colibri的纯C语言推理引擎,成功在仅25GB内存的消费级笔记本上运行拥有7440亿参数的开源模型GLM-5.2,被誉为“极客精神的极致展现”。
Colibri核心仅约2400行C语言代码,完全零依赖,不需要Python、不需要GPU、不需要BLAS数学函数库。开发者表示速度不是重点,达成目标才是,只是想让它跑起来,即使很慢也没关系。

GLM-5.2由智谱开发,拥有7440亿参数,训练数据量达28.5万亿tokens,是目前能力最强的开源模型,若采用传统密集模型架构,光是将模型载入内存就需要超过1.5TB。
但GLM-5.2采用MoE混合专家架构,虽然总参数量达7440亿,每次处理一个token时只会启动约400亿个参数(约5%),其余参数以专家形式存在,被选中时才会调用。
Colibri的开发者正是抓住了这个特性,每次token处理时实际改变的权重只有约11GB,其余密集层(注意力机制、共享专家、嵌入层等约170亿参数)可以常驻内存。

实际性能方面,开发者在WSL2环境(12核心、25GB内存、NVMe通过VHDX)测得模型载入约30秒,常驻内存9.9GB,聊天时峰值RSS约20GB。
冷启动时每次token需读取约11GB磁盘数据,推理速度约每秒0.05至0.1个token。快取预热后配合MTP投机解码,有用户反馈在更快NVMe和更多内存的配置下可达每秒1个token以上。
具体实现上,密集部分以int4量化后常驻内存,其余21504个路由专家存放在硬盘上,总计约370GB,每个专家约19MB,按需求载入。这些专家来自75个MoE层每层256个专家,加上MTP预测头。
为提升效率,Colibri还进行了了多项优化,每层LRU缓存让常用专家留在内存中,异步专家预读让磁盘读取与矩阵运算重叠进行,路由前瞻预取利用相邻层之间71.6%的路由可预测性提前载入下一层可能需要的专家。
此外还实现了GLM-5.2原生的MTP多token预测投机解码,int8量化下草稿接受率达39%至59%,每次前向传播可产生2.2至2.8个token。MLA注意力机制将KV缓存压缩57倍,每个token只需576个浮点数而非32768个。

《靠2400行C代码:25GB内存跑通7440亿参数GLM-5.2!就是速度太感人》转载自互联网,如有侵权,联系我们删除,QQ:369-8522。
相关图文
-
美光带来新选择!1γ LPDDR5X内存新增多个规格
快科技7月16日消息,美光(Micron)推出非二进制LPDDR5X内存,新增6GB、12GB、24GB三种容量选项,给客户更多设计灵活性。LPDDR5X是目前手机和笔记本电脑的主流内存,美光在2022年推出,虽然LP... -
4.21亿美元赔偿还不够!美国重启337调查:英伟达、三星、谷歌等全涉案
快科技7月16日消息,美国国际贸易委员会于当地时间7月15日正式对特定动态随机存取存储器(DRAM)设备及其下游产品和组件启动337调查。调查编号为337-TA-1511。此次调查基于加州尔湾存储技术企... -
黄仁勋高调点赞!SK海力士登陆纳斯达克:265亿美元募资规模超越阿里巴巴
快科技7月16日消息,SK海力士美国存托凭证(ADR)近日在纳斯达克全球精选市场挂牌交易。此次发行1779万股新股,发行价定为每份149美元,共筹集约265.071亿美元资金。这一规模超过了阿里巴巴20... -
长鑫开启申购第一天:全球存储股集体吓跌!
快科技7月16日消息,国产DRAM龙头长鑫科技开启新股网上及网下申购,发行价8.66元/股,一签500股,中签需缴款4330元,估值约5791.8亿元。若全额行使超额配售权,募资规模将达666亿元,有望成为今... -
海盗船SHUGO DDR5收藏级内存国内首发!2026 ChinaJoy见
快科技7月16日消息,海盗船(CORSAIR)宣布其收藏级内存SHUGO DDR5将在2026 ChinaJoy上国内首发登场。SHUGO即日语"守护"的音译,这款内存主打限量艺术外观,联合专业画师打造两款主...












