我们仍不清楚人们实际如何使用AI
一个名为AI Observatory的新独立研究平台汇总了七个数据集中近25,000次真实用户对话,为研究人员提供了关于人们实际如何使用ChatGPT、Claude和Grok等AI工具的真实视角。研究发现不同模型的使用模式差异显著,例如Grok用户偏向新闻和政治,Claude吸引程序员,ChatGPT则常用于作业,这些差异在AI公司的报告中并未体现。该独立数据旨在帮助研究人员和政策制定者更好地评估AI的益处与风险。
一个名为AI Observatory的新独立研究平台汇总了七个数据集中近25,000次真实用户对话,为研究人员提供了关于人们实际如何使用ChatGPT、Claude和Grok等AI工具的真实视角。研究发现不同模型的使用模式差异显著,例如Grok用户偏向新闻和政治,Claude吸引程序员,ChatGPT则常用于作业,这些差异在AI公司的报告中并未体现。该独立数据旨在帮助研究人员和政策制定者更好地评估AI的益处与风险。
SynthePulse Insight · AI 深度解读
版本 1 · 1 个来源
当AI公司只展示他们想让你看到的数据时,一个名为AI Observatory的独立项目通过分析近2.5万段真实对话,揭示了工作用途之外的大量敏感行为,以及不同模型间的显著差异。
AI公司如Anthropic和OpenAI定期发布使用报告,但研究者指出他们只发布想让你看到的数据。斯坦福大学博士生Anka Reuel表示,没有独立来源可以证实这些数据。她共同领导了AI Observatory项目,旨在通过聚合用户同意收集的真实对话,为研究者和政策制定者提供独立信息。
AI Observatory聚合了2023至2025年间7个数据集中的24,521段对话,涉及5,000名用户和52个模型,包括ChatGPT、Gemini、Claude和Grok。相比之下,Anthropic的最新指数基于100万段Claude对话,OpenAI的报告分析了150万段ChatGPT对话。
Anthropic Economic Index是最知名的使用数据来源,但聚焦于工作相关用途。当AI Observatory团队应用Anthropic的方法时,发现48%的对话会被过滤掉。这些被过滤的对话更可能涉及健康与关系(44.2%对31.2%)、成人或非法话题(7.9%对2.1%)、骚扰与仇恨(27.5%对5.66%)以及性内容(16.7%对2.4%)。
OpenAI 2025年的报告也显示,仅30%的消费者使用与工作相关。Anthropic虽发布过关于支持、陪伴甚至CSAM的单独博客,但研究者认为综合视角更有助于一致理解。
研究发现不同模型的使用差异显著:Grok和Gemini更常用于信息检索,Grok尤其流行于新闻和政治,但也是 misinformation 集中的地方;Claude更常用于编程,Gemini用于社交和角色扮演,ChatGPT用于作业帮助。
随时间推移,对话变得更长、更精细,闲聊增多,表明AI陪伴增加,而AI自我披露减少。敏感使用(如性骚扰和仇恨言论)下降,可能表明平台防护措施更有效。不同版本的ChatGPT也有差异:GPT-3.5时代对话较短,GPT-4o时代更长且更具迭代性。
AI Observatory的数据来自自愿提供的来源,可能低估敏感使用,因此研究者警告其发现不代表所有AI使用。此外,这些对话与大型实验室的数据相比只是九牛一毛。
Anthropic代表表示其研究反映团队特定问题,并支持外部独立研究;OpenAI未回应评论请求。AI Observatory的数据将对研究者开放,团队希望扩展数据集。Reuel呼吁AI公司与独立研究者共享数据,同时保护隐私,否则决策者将“完全在黑暗中操作”。
本文基于MIT Technology Review的报道,其中引用了AI Observatory研究者的直接陈述和具体数据。公司报告的数据(如Anthropic和OpenAI的)为来源声明,未经独立验证。AI Observatory的发现基于自愿提供的数据,可能低估敏感使用。
AI使用情况远比公司报告所呈现的复杂,独立数据源对于理解真实使用模式至关重要,但现有独立数据仍有限,且公司数据不公开,导致决策者面临信息盲区。
主报道
主报道来源