Kog 用软件优化释放 GPU 更多推理能力

内容管家 AI领域评论0字数 1732阅读5分46秒阅读模式
Kog 用软件优化释放 GPU 更多推理能力

AI 推理速度的战事正在升温。Cerebras 凭借专用芯片在 5 月 IPO 上市,市场反响热烈;与此同时,一家法国初创公司 Kog 却在押注另一条路——通过软件优化,让企业数据中心里已有的 AMD MI300X、NVIDIA H200 等主流 GPU 释放更大潜力。

技术预览引发关注,200 个商业合作意向涌入

Kog 在 5 月发布了一份技术预览,宣称在标准数据中心 GPU 上实现了单请求每秒 3000 token 的解码速度,演示基于 AMD MI300X 和 NVIDIA H200 两款芯片。该演示直接登上了 Hacker News 热门榜首

技术预览引发了热烈讨论:有人遗憾地发现这项能力暂不支持笔记本电脑中的 GPU,也有人看到了其中蕴含的商业机会。Kog 首席执行官 Gaël Delalleau 透露,公告发布后公司收到了超过 200 个有实际价值的商业合作意向,远超出纯围观层面。

从软件工程入手,优先解决专业用户痛点

根据早期用户反馈,Kog 判断软件工程师将是其首个大规模落地场景。熟悉 Claude Code 的用户往往深有体会:复杂任务有时需要等待数小时才能拿到结果。Anthropic 自身也深知速度本身具有货币价值——Claude Fast Mode 设有专门的价格倍率

Kog 正在争取那些因延迟而放弃 AI 工作流的客户,尤其是将 AI 融入专业任务流程的企业用户。此外,公司还与一批设计合作伙伴建立了联系,这些合作伙伴允许用户通过提示词直接生成游戏和应用——推理速度提升意味着更快的产出和更多的收入。

Delalleau 承认市场尚未完全成熟。调研显示,潜在客户普遍不愿意自行微调小模型。因此 Kog 自发布以来全力押注于加速大模型的研发,以匹配已有需求。

"30 倍提速"目标:现实与挑战

Kog 喊出了"比现有方案快 30 倍"的目标。其演示中确实达到了每秒 3000 token 的惊人成绩——但使用的只是一个参数量仅约 20 亿的小型专用模型 Laneformer 2B,该模型现已开源

质疑声不少,但 Delalleau 态度坚定。他相信同样的方法同样适用于大语言模型(LLM)。在他看来,GPU 不擅长解码的说法早已过时,新一代 GPU 拥有越来越大的内存带宽,正是他们要挖掘的对象。

欧洲 AI 推理赛道:Kog 的差异化定位

Kog 并非唯一一家试图用软件优化突破 GPU 性能上限的团队。另一家法国初创公司 ZML 走的是硬件无关路线,通过绕开 Nvidia CUDA 来支持多种芯片的快速推理。Delalleau 认为 Kog 更接近斯坦福大学实验室 Hazy Research 的方向,且在 GPU 加速层面做得更深。

这与创始人背景密不可分。Delalleau 毕业于法国巴黎综合理工学院(École Polytechnique)凝聚态物理专业,后转投进攻性网络安全(白帽黑客)领域。他表示,网络安全研究的思维方式深刻影响了他现在的团队建设——"在科学层面,要深入理解物理定律和 GPU 的运行原理;在黑客层面,要能够从底层逆向分析,直到汇编语言和二进制层面,搞清楚系统真正如何运作,并将其用于原本不一定是设计用途的场景。" Delalleau 曾四次入围 DEF CON CTF 大赛决赛。

团队规模与扩张节奏

这种深度定制的方法代价是:每支持一款新 GPU,都需要投入"数周甚至数月"的工程研究。目前公司仅11 人,这在可预见的未来限制了 Kog 能覆盖的芯片数量。

从长期规划看,Kog 希望通过将方法论融入基于 Agent 的自动化流程,来支撑更多芯片和模型。随着欧洲在 AI 芯片与大模型两方面寻求自主可控,Kog 這一定位或许能带来额外的战略助力。公司目前已获得 Scaleway、Bpifrance 以及French Tech 2030计划的支持。

下一步:今年 9 月验证大模型,融资节奏清晰

眼下 Kog 最紧迫的任务是证明自己的方案在真正的大语言模型上同样有效。这也将是其获得新一轮融资的关键。Delalleau 表示:"一旦我们在 9 月前后实现首个主流模型的 10 倍提速,就能开始向市场展示客户吸引力,进而启动 A 轮融资。"

本周科技要闻速览

AI 水印风波:Anthropic 推出文本溯源新功能

Anthropic 宣布将为其 AI 模型生成的文本添加水印标识,以防止用户在工作或课堂场景中滥用。这一做法引发部分 Claude 用户不满,他们担心水印会暴露自己将 AI 用于"摸鱼"或作业代写的痕迹。

与此同时,Meta 创始人马克·扎克伯格发布了一份 AI 宣言,阐述其对 AI 发展的愿景,但不少业内人士认为这份"宣言"恰恰是公众对 AI 产生反感的根源之一——过于宏大的叙事与实际落地之间存在明显落差。

网红经济乱象:Cookie Stuffing 与虚假 Wi-Fi

据报道,Phoebe Gates(比尔·盖茨女儿)和 Sophia Kianni 早在数月前便知晓网红营销平台 Phia 存在"Cookie Stuffing"(Cookie 填充)问题,但迟迟未予曝光。Cookie Stuffing 是一种通过虚假追踪代码窃取佣金的作弊手段,常见于联盟营销领域。

航空安全方面,达美航空(Delta)正在调查一起事件:有人在航班飞行途中私自搭建伪造 Wi-Fi 热点,意图截获乘客网络流量。这类攻击属于典型的"邪恶双胞胎"(Evil Twin)攻击,旅客在公共网络环境下需格外警惕。

前沿研究:对抗性图案可干扰监控摄像头

安全研究员发现,通过在物体表面印刷特定"对抗性图案",可使监控摄像头的人体检测模型完全失灵,从而实现规避视觉监控的目的。这一发现再次引发关于隐私保护与 surveillance 技术边界的讨论。

延伸阅读

 
内容管家

发表评论