RTX 4060 跑 35B 模型,每秒 39 Token?伯克利、MIT 联手开源 FreeToken
伯克利与 MIT 联手开源 FreeToken 项目,旨在让 RTX 4060 显卡运行 35B 参数模型时达到每秒 39 Token 的推理速度。该项目通过优化量化算法与内存管理技术,显著降低了大语言模型的硬件门槛。FreeToken 计划将推动 AI 模型在消费级设备上的普及,相关代码已公开供开发者使用。
EVENT DOSSIER
美国加州大学伯克利分校与麻省理工学院(MIT)联手开源了名为 FreeToken 的项目。该项目旨在通过优化量化算法与内存管理技术,使消费级 RTX 4060 显卡能够高效运行 35B 参数的大语言模型,实现每秒 39 Token 的推理速度。FreeToken 计划致力于降低大模型在消费级设备上的硬件门槛,推动 AI 模型的普及,相关代码已公开供开发者使用。
伯克利与 MIT 联手开源 FreeToken 项目,旨在让 RTX 4060 显卡运行 35B 参数模型时达到每秒 39 Token 的推理速度。该项目通过优化量化算法与内存管理技术,显著降低了大语言模型的硬件门槛。FreeToken 计划将推动 AI 模型在消费级设备上的普及,相关代码已公开供开发者使用。