资讯

RTX 4060 跑 35B 模型,每秒 39 Token?伯克利、MIT 联手开源 FreeToken

InfoQ中文·2026/9/5 17:00:00🔗 原文

📋总体概括

伯克利与MIT团队联合开源推理框架FreeToken,宣称可在消费级显卡RTX 4060上以每秒39 Token的速度运行35B参数大模型。该方案通过优化内存与计算调度,让低显存硬件承载远超其容量的模型,降低了本地部署大模型的门槛。若实际表现与宣称相符,将改变大模型推理对高端GPU的依赖格局,对边缘部署和开源社区有实际意义。

关键信息

  • 伯克利与MIT联合开源FreeToken推理框架,主打消费级显卡跑大模型能力
  • RTX 4060可运行35B参数模型,推理速度达每秒39 Token
  • 该方案瞄准低显存硬件部署场景,降低本地大模型使用门槛
  • 成果以开源形式发布,面向社区与边缘部署场景

🔥犀利点评

4060只有8GB显存,跑35B模型必然靠量化加显存卸载,39 Token/s大概率是激进量化换来的,精度损失和长文本表现才是真正的试金石。学术界这种拉满工程优化的玩法值得鼓励,但别急着宣布『消费级显卡革命』——跑得动和跑得好是两回事,等第三方复现数据再说。

本文由本站自动聚合,以下为原始来源:前往 InfoQ中文 阅读全文