OpenAI 内部 Lily 项目曝光:人工审核 ChatGPT 用户聊天记录以优化大模型
9 月 15 日消息,众所周知,ChatGPT 这类平台的对话日志会被用来优化模型。但在此之前,这套处理机制一直是个谜。404 Media 刚刚发布了一份报道,披露了 OpenAI 对聊天记录开展人工审核的整套流程,介绍了审核如何运作,以及审核人员有时会读到用户私人信息这一情况。

OpenAI 内部这项评估项目代号为莉莉计划(Project Lily)。该媒体获取到了该项目的操作指引文档、Slack 工作群组记录、真实的 ChatGPT 对话样本,还有用于给对话分级的评分体系。从事这项工作的人员被称作“提示词审核员”。他们的工作内容并不复杂:查看经过匿名化处理的真实用户聊天记录,评判 ChatGPT 回复的质量;评估回答是否切题,同时检查回复文本是否过度出现“AI 式话术”、居高临下的说教语气、表情符号、谄媚口吻等问题。回复禁止拟人化表述,也不允许编造“个人经历”。也就是说,ChatGPT 可以说“我查到了一些相关信息”,但不可以写成“身为一名厨师,我喜欢……”或者“我明白这种感受”。
一名审核员表示,这份工作“十分机械重复”,但时薪据称超过 50 美元(注:现汇率约合 336.3 元人民币),对于这样难度不算高的工作而言报酬相当可观。这名审核员还提到,项目的操作指引一直在改动,不同版本之间还经常自相矛盾,多数软件开发人员应该对此深有体会。
但这名工作人员认为,绝大多数用户并不知道自己的聊天内容会被其他人阅读。这件事尤其令人担忧:不少用户把 ChatGPT 当作临时倾诉对象、心理疏导对象,向 AI 吐露内心深处的秘密。
虽然聊天记录据称会先经过一轮匿名处理,审核人员看不到用户名。但 OpenAI 向 404 Media 承认,过滤环节依然有可能漏掉部分个人数据,简短会话出现这类问题的概率更高。该媒体还指出,大量对话里用户明确请求 ChatGPT 对谈话内容予以保密。交给审核人员的会话版本甚至附带一份“用户记忆摘要”,里面汇总了用户的提问、兴趣偏好、上下文信息,甚至有可能包含位置信息。
关键点在于:莉莉计划并不会专门核查回答内容事实上是否准确,仅会标记那些显而易见的错误。这意味着至少还有另外一支(或多支)团队,在开展独立的效果评估。同样,这套评分审核,也和排查用户是否存在伤害他人(抑或是伤害自身)意图的人工安全审查属于两套独立流程。
该项目的存在也说明,和 AI 公司力图塑造的公众印象相反,大模型的迭代进步并不仅仅依靠技术升级与更优质的训练数据集;依然需要相当数量具备相应能力的人类参与其中。
绝大多数面向普通用户的聊天机器人都带有类似设置:“允许使用你的对话记录改进产品”。几乎所有聊天产品的该项开关默认都是开启状态,不少付费订阅方案也不例外。不过 ChatGPT 面向企业版、商业版以及教育版客户时,该项设置默认关闭。
但这个切换开关不具备回溯效力。也就是说,已经存入 ChatGPT 数据库里的历史聊天记录会继续保留,除非用户主动申请删除。另外,删除操作同样无法追溯:即便用户删除对话,对应的内容或许早已被抓取、完成匿名处理,并留存于某个数据集当中。
404 Media 就此发起问询,一开始 OpenAI 没有回应:用户是否被明确告知聊天记录有可能交由人工审阅。之后该公司仅提供了一份常见问题页面链接,该页面提到出于模型优化目的会开展人工审核。经核实,这份公示至少已经存在两年,实际年限可能更久。在这篇深度报道发布之后,OpenAI 修改了帮助页面,补充说明用户如何选择退出数据收集;但修改后的文档当中依旧没有提及会有工作人员人工读取会话内容。
这类数据收集与人工审阅的做法在各大服务商当中普遍存在。谷歌的 Gemini 就在隐私中心明确写明“部分保存的聊天记录可能由人工审核”。Anthropic 也持有相似立场,专门开设网页说明该事项。而 Perplexity 的态度尚不明确,其隐私政策既没有确认、也没有否认工作人员可以访问聊天日志。
声明:本文转载自IT 之家,转载目的在于传递更多信息,并不代表本社区赞同其观点和对其真实性负责,本文只提供参考并不构成任何建议,若有版权等问题,点击这里查看更多信息!