Kog is going deeper to squeeze more inference out of GPUs | TechCrunch
法国初创公司 Kog 致力于通过软件优化挖掘常规 GPU 的更多推理潜力,其 CEO Gaël Delalleau 表示该软件工程有望成为首个用例。Kog 在五月于 Hacker News 发布技术预览,证明标准数据中心 GPU(如 AMD MI300X 和 Nvidia H200)可实现极快单次请求解码,虽未覆盖笔记本电脑 GPU,但已吸引超过 200 个实质性商业线索。公司计划针对因延迟而放弃 AI 工作流的客户以及依赖提示词生成游戏和应用的设计合作伙伴,目前正专注于加速大模型开发以应对需求,目标是将大型语言模型推理速度提升 30 倍。尽管演示中基于开源 Laneformer 2B 小模型实现了每秒 3,000 个 token 的吞吐量,Delalleau 坚信该软件优化方法同样适用于参数规模更大的 LL…