Claude 识别到枪击威胁后转交人工并报警
有人把 Claude 当成日记使用。模型识别到枪击威胁后,把内容交给 Anthropic 人工审核,随后报警。
有人把 Claude 当成私人日记来写。模型从文字里识别出枪击威胁后,没有继续当作普通聊天,而是交给 Anthropic 的人工审核,随后向警方报案。
这件事说明对话内容会被安全策略送去人工复核。把不想被第三方看到的内容写进在线模型,本身就有外传的可能。
报道:https://www.ithome.com/1/009/795.htm
所有资源免费浏览和下载,欢迎收藏与分享。
评论区
0 条登录后可以评论和回复。
还没有评论,来留下第一条。