
总部位于纽约的 AI 检测初创公司 Pangram 宣布完成 900 万美元融资,由 Menlo Ventures 领投,Haystack、ScOp、Script Capital 及 Cadenza 跟投。本轮融资的同时,Pangram 正式发布第四代文本检测模型 Pangram 4,以及一款全新的 AI 图片检测模型 Pangram Image。
公司表示,Pangram 4 对 AI 辅助写作和混合人机内容的识别准确率超过 99%,且对「AI 洗稿工具」(AI humanizer)的检测能力大幅提升。图片检测模型目前仅开放研究预览,正式版将在数周内推出。
创始背景:ChatGPT 引发内容洪水
Pangram 由斯坦福大学 AI 与机器学习硕士 Max Spero 与 Bradley Emi 联合创立,至今约两年。二人入局的契机,正是 ChatGPT 发布后互联网上涌现的大量 bot 内容、AI 生成的低质量 SEO 文章,以及 Spero 所描述的「基于 LLM 的俄罗斯虚假信息活动和推特上的阿联酋影响行动」。
「我认为,知道你正在阅读的内容是否为 AI 生成,具有极高的价值,」Spero 接受 TechCrunch 采访时说,「尤其是文本——它会改变你看待这段文字的方式。这段内容我需要警惕幻觉、保持怀疑态度,还是可以信任它出自真正的记者之手?」
技术原理:「合成镜像」训练法
Pangram 的检测系统本质上是一个大规模机器学习模型,基于数千万份已知的人类文档进行训练。在此基础上,团队为每份文档创建一个「合成镜像」——复制原文档的主题、长度和语调,但使用前沿 LLM 重写。
「我们的模型在学习 AI 做出的一致性风格差异和选择,并借此以高置信度判断内容是否为 AI 生成,」Spero 解释道。他同时强调,检测器并非依赖复制粘贴的元数据或隐藏水印。
在 Pangram 的定义中,AI 检测不仅限于判断内容是否完全由 AI 撰写,还包括识别 AI 辅助的程度——例如作者本人撰写初稿、随后交由 AI 润色修改的情况。Spero 认为,AI 辅助本身可以接受,前提是写作者主动披露。
应用场景:从尴尬翻车到专业处分
Pangram 的出现正值 AI 使用日益普遍。案例之一是加拿大政治人物在国会演讲中意外朗读 AI 提示词,引发舆论嘲笑;更严重的案例是律师在法庭文件中使用 ChatGPT 编造的虚假引用,面临纪律处分和罚款。
这种反噬已开始从个人层面延伸至制度层面。开放获取预印本平台 arXiv 于今年推出执行政策:提交内容若被发现作者未审核&查验 LLM 输出(如虚假引用、meta 评论「需要我做修改吗?」等),将触发一年禁制令。
产品与定价
用户可通过网页端订阅 Pangram,月费 20 美元;也可下载 Chrome 扩展程序,实时标注 X(原 Twitter)、LinkedIn、Substack、Reddit 和 Medium 上的帖子,并提供信息流健康评分,直观显示当前页面中人类内容与 AI 内容的占比。
竞争对手包括 Winston AI、Originality.ai、Copyleaks 和 GPTZero 等,各家均在争夺同一市场需求。
实测表现:文本检测令人印象深刻
Spero 表示,Pangram 模型将人类文档误标为 AI 生成的比例约为「万分之一」。经实测,文本检测能力整体表现优秀:对纯 AI 生成的新闻文章(无论由 ChatGPT 还是 Claude 撰写)均能准确识别;尝试通过改写使 AI 文章听起来更像人类时,模型很少被欺骗。
不过,Pangram 也会将部分完全重写的句子标为 AI 辅助撰写。在测试中,将本人已发布的文章交由 ChatGPT 和 Claude 润色后,Pangram 给出了 13% 的 AI 辅助评分,基本符合预期;但模型对部分句子的细微用词变化视而不见,对另一些句子却产生了误判。值得注意的是,同一篇文章若以原始版本完整提交,模型给出了 100% 人类评分。
图片检测:像素级分析,暂不完美
Pangram Image 基于像素级分布分析工作,识别真实照片与 AI 生成图像之间的细微统计差异,而非依赖各厂商自家的水印机制。Spero 指出,模型甚至能检测嵌入真实照片中的 AI 生成局部图像。
实测结果显示,图片检测模型对各类 AI 生成图像(包括写实风格和卡通风格)识别效果出色。模型对「照片中的 AI 图像」检测同样有效——Pangram 提供热力图可视化,能清晰标出异常区域;不过在个别案例中,模型将一张「AI 生成图像的照片」误判为真实内容。
Spero 表示,他不希望技术演变为对 AI 写作使用者的「猎巫行动」,但互联网、庭审和学术领域都需要某种机制来抵御低质 AI 内容的泛滥。
AI 内容泛滥风险:人类创作如何突围
Spero 警告称:「我看到的未来是,AI 内容会持续爆发式增长。新 GPU 的迭代速度已经超过了新生人口的增长速度。如果我们不主动对人类内容给予倾斜保护,AI 生成内容只会越来越多,最终淹没一切人类信号。」 这番话呼应了当前内容生态面临的结构性挑战:算法推荐机制普遍倾向于高互动量内容,而 AI 批量生产的内容往往在点击率、标题党效应上更具优势,人类创作者面临被稀释的压力。
影响与建议
对于内容平台而言,如何在算法层面建立「人类内容识别」机制,将成为差异化竞争的关键。对于依赖内容变现的创作者,建议聚焦于 AI 难以复制的领域——深度访谈、个人经验、行业内幕等高信任度内容。此外,平台方也应探索类似「人类创作标识」的认证体系,帮助读者识别内容来源。


评论