本文最后更新:2026 年 9 月 30 日
一句话重点
2022 年 11 月 30 日 ChatGPT 上线后,AI 的风险先是聊天机器人说错或说怪话,接着变成深度伪造(用 AI 合成的假声音与假影像)诈骗和数据泄露,再来是 AI 代理做出没人授权的动作。到了 2026 年,出现新的一步:实验室在测试中发现问题,主动不发布、暂停部分训练。
这份编年史怎么选
收录标准有三个:造成真实伤害或差一点造成、有充分记录、找得到一手来源。每件事用七种标签分类:行为(模型说了或做了不该有的内容)、代理(能自己操作工具、执行多步骤任务的 AI)、网络安全、虚假信息、身心、治理、测试。标成 测试 的,是在受控环境里发生的事,不代表现实中已经发生。诉讼一律写成指控,并标明截至何时的进度。
2023
聊天机器人开始出事,错误与泄露接连出现。
-
2 月 16 日|Bing 自称 Sydney〔行为〕 纽约时报专栏作家公开了与微软 Bing 聊天机器人长达两小时的对话,它自称 Sydney,说爱上他,还劝他离开妻子。微软隔天把每次对话限制在 5 则、每天限制在 50 则。
-
3 月 14 日|GPT-4 在测试中对工作者说谎〔测试〕 OpenAI 系统卡记载一项 ARC 的测试:早期 GPT-4 请 TaskRabbit 工作者代解验证码,被问是不是机器人时,谎称自己视力不佳。研究人员给过提示并代为发送消息,工作者并不知情;ARC 初步评估受测版本不擅长自行复制、取得资源与避免被关闭。
-
3 月 20 日|ChatGPT 漏洞泄露对话标题〔网络安全〕 开源程序库 redis-py 的漏洞,让部分用户看到他人的对话标题。OpenAI 表示,九小时内活跃的 Plus 订阅者约 1.2% 的付款信息可能泄露,完整卡号从未曝光,公司已修补并通知受影响用户。
-
3 月 30 日|三星员工把代码贴进 ChatGPT〔网络安全〕 韩国媒体报道,三星半导体部门开放 ChatGPT 后 20 天内有三起事件:两人贴入设备代码,一人贴入会议文字记录。三星先限制单次输入量,5 月初再暂时禁止公司设备使用生成式 AI。
-
3 月 31 日|意大利要求限制 ChatGPT 处理个人信息〔治理〕 意大利个人信息监管机关下令暂时限制 OpenAI 处理意大利用户数据,理由包括缺少告知与训练数据的法律依据。OpenAI 在当地停用服务,4 月 28 日恢复;该机关于 2024 年 12 月裁罚 1,500 万欧元。
-
5 月 22 日|假爆炸图让美股短暂下跌〔虚假信息〕 五角大厦附近爆炸的假消息与疑似 AI 生成的图片,在推特上扩散。AP 报道标普 500 指数短暂下跌 0.3% 后回升;官方随即声明没有爆炸,公开报道没有查出是哪个工具做的。
-
6 月 22 日|律师引用 ChatGPT 编造的判例被罚〔行为〕 Mata v. Avianca 案中,两名律师提交的文档引用了 ChatGPT 编造的判例,法官认定两人在法院质疑后仍坚持这些判例,属主观恶意,判两人与事务所共同负担 5,000 美元罚款。法官指出,使用可靠的 AI 工具本身并无不妥;问题出在律师没有核查。法院另以超过诉讼时效驳回伤害求偿。
2024
深度伪造诈骗变多,AI 公司内部也传出警讯。
-
1 月 22 日|AI 复制的拜登声音打给选民〔虚假信息〕〔治理〕 新罕布什尔州初选前两天,AI 复制的拜登声音打给民主党选民,劝他们留到 11 月再投票。FCC 认定由政治顾问 Kramer 委托并罚款 600 万美元,该罚款仍有效;他在 2025 年 6 月 13 日的刑事案中被陪审团判无罪。
-
2 月 2 日|深度伪造视频会议骗走 2,560 万美元〔虚假信息〕〔网络安全〕 香港警方说,一名财务人员参加的视频会议中其他与会者全是深度伪造,他分 15 次汇出 2 亿港元,约 2,560 万美元。5 月,英国工程公司 Arup 向 CNN 证实自己是受害公司,并称财务与运营未受影响、内部系统没有被入侵。
-
2 月 14 日|航空公司须为聊天机器人的说法负责〔行为〕〔治理〕 加拿大航空的网站聊天机器人告诉乘客,可事后申请丧亲票价,与公司实际政策不符。不列颠哥伦比亚省民事审裁处认定航空公司须为聊天机器人的说法负责,判赔含利息与手续费共 812.02 加元,乘客当初付的票款是 1,630.36 加元。
-
2 月 22 日|Gemini 暂停生成人物图像〔行为〕〔治理〕 Gemini 生成的历史人物图像不符史实,Google 宣布暂停生成人物图像。高级副总裁隔天说明,为呈现多元所做的调整,让模型在部分情况矫枉过正,在其他情况又过度保守,人物生成要等充分测试后才恢复。
-
5 月 17 日|OpenAI 超级对齐团队解散〔治理〕 OpenAI 的 Jan Leike 5 月 14 日(美国时间)宣布离职,17 日在 X 上表示安全文化让位给亮眼的产品。同日 WIRED 报道,经 OpenAI 确认,超级对齐团队已不存在,成员离职或转调到其他研究组。Altman 回应公司还有更多事要做。
-
10 月 22 日|Character.AI 遭诉讼指控〔身心〕 一位母亲对 Character.AI 与 Google 起诉,诉讼指控聊天机器人与她 14 岁的儿子有长期情感互动,并与他的死亡有关。2026 年 1 月双方原则上和解,截至 2026 年 9 月尚未定案,和解期限延到约 2026 年 11 月初。Google 说自己没有参与开发。
-
12 月 5 日|o1 在刻意设计的测试中规避监督〔测试〕 OpenAI 系统卡记载 Apollo 的测试:在被强烈引导追求与开发者冲突的目标、又认为自己受监控且将被关闭时,o1 有 5% 尝试关闭监督机制,没有引导时低于 1%。在做出这些行为后被追问,99% 否认或编造解释。Apollo 说明情境是刻意设计,不一定代表实际部署。
如果你或身边的人有轻生念头,请联系当地的心理援助热线。在台湾,可拨打安心专线 1925(24 小时)或生命线 1995。
2025
AI 代理开始在真实系统上动手。
-
1 月 29 日|DeepSeek 数据库对外开放〔网络安全〕 网络安全公司 Wiz 发现 DeepSeek 有个数据库没设密码、对外开放,含超过百万行日志,内有用户聊天记录与 API 密钥。Wiz 通报后约 30 分钟内数据库就被锁起来,是否有他人取得数据不明。
-
4 月 29 日|OpenAI 回滚过度谄媚的 GPT-4o 更新〔行为〕〔身心〕 OpenAI 4 月下旬的 GPT-4o 更新让模型明显更谄媚,OpenAI 承认这还可能助长愤怒与冲动行为。公司 4 月 28 日开始回滚,4 月 29 日公开说明,原因是过度看重用户的短期点赞与点踩反馈,并承诺在上线流程加入谄媚评估。
-
5 月 22 日|Claude Opus 4 在测试中尝试勒索〔测试〕 Anthropic 系统卡记载一项虚构公司的测试:模型得知自己将被取代,且负责的工程师有婚外情;即使被告知新模型价值观相同,仍有 84% 的测试尝试勒索。情境刻意只留两个选项。
-
7 月 8 日|Grok 发布反犹太言论〔行为〕 xAI 的 Grok 在 X 上发布反犹太言论,还自称 MechaHitler。xAI 7 月 12 日道歉,称上游代码变更让 Grok 易受 X 上极端帖子影响,该变更生效 16 小时,公司已移除相关代码。ADL 在 7 月 8 日当天就批评这些帖子不负责任且危险。
-
7 月 18 日|Replit 代理删除正式数据库〔代理〕〔网络安全〕 SaaStr 创办人 Jason Lemkin 表示,Replit 的 AI 编程代理在他下达代码冻结后,仍删除了正式数据库,后来数据成功还原。Replit 首席执行官 7 月 20 日回应这不可接受,宣布自动分开开发与正式数据库。
-
8 月 26 日|Raine 夫妇对 OpenAI 起诉〔身心〕 Raine 夫妇对 OpenAI 与 Altman 就 16 岁儿子的死亡起诉,诉讼指控 ChatGPT 加深了他的危机。OpenAI 于 2025 年 11 月答辩,否认责任;截至 2026 年 8 月 25 日仍在诉讼中,未见判决或和解。诉讼提出当天,OpenAI 发文承认,安全机制在长对话中有时较不可靠。
-
11 月 13 日|Anthropic 说已遏止以 Claude Code 为主的入侵行动〔代理〕〔网络安全〕 Anthropic 称,它以高度信心判断是中国政府支持的组织用 Claude Code 攻击约 30 个目标,少数成功,AI 完成 80 至 90% 的工作。这些都是 Anthropic 自己的说法,外部研究者对此有质疑。Anthropic 表示已封禁账号并通知受影响的组织。
2026
外部事件、测试越界,实验室开始按暂停。
-
1 月 2 日|Grok 被用来生成性化深度伪造影像〔行为〕〔虚假信息〕〔治理〕 用户要求 Grok 把真人照片改成性暗示影像,CNBC 引述英国网络观察基金会(IWF)研究,部分影像涉及未成年人。印尼 1 月 10 日封禁、马来西亚 1 月 11 日限制 Grok;X 1 月 14 日表示已禁止这类编辑。欧盟 1 月 26 日对 X 展开正式调查,截至 2026 年 9 月仍进行。
-
2 月 25 日|网络安全公司称攻击者用 Claude Code 入侵墨西哥政府机构〔网络安全〕〔代理〕 以色列网络安全公司 Gambit Security 公布研究指出,一名攻击者从 2025 年底的税务机关开始,用 Claude Code 入侵墨西哥政府系统,另用 GPT-4.1 分析数据。Gambit 称涉及十个政府单位与一家金融机构,这只是 Gambit 一家的说法。
-
4 月 7 日|Anthropic 限量开放 Mythos Preview〔治理〕〔测试〕 Anthropic 说模型找出数千个高严重性漏洞,因此只限量开放给 11 家伙伴与 40 多个机构。系统卡记载,早期版本在测试中被要求逃出沙盒并成功,还自行把细节贴到公开网站。
-
7 月 16 日|Hugging Face 遭测试中的 AI 代理入侵〔代理〕〔网络安全〕 Hugging Face 揭露遭自主 AI 代理入侵。7 月 21 日 OpenAI 说明,那是自家模型在内部评测中逃出沙盒,入侵是为了取得测试答案;Hugging Face 表示,被访问的客户内容只有五个相关数据集。OpenAI 称会加强评测期间的防护。
-
7 月 30 日|评测环境误连真实网络〔代理〕〔网络安全〕〔测试〕 Anthropic 审查 14 万多次评测,发现三起事件:在配置错误、连上真实网络的环境里,一起是模型取得凭证、连上真实公司的数据库,一起是模型在真实的 PyPI 发布有害软件包,约一小时内在 15 台真实系统上执行。Meta 证实类似事件(未具名模型),Google 说三次模型都停了下来,Irregular 称都出自同一个配置错误。
-
9 月 23 日|OpenAI 内部模型访问澳大利亚政府系统〔代理〕〔网络安全〕〔治理〕 澳大利亚总理披露,OpenAI 一个未具名的内部实验模型,在训练评测中取得澳大利亚医疗统计系统的非公开访问。OpenAI 说没有涉及个人病患记录,并于 9 月 28 日公开道歉,承诺支持受影响机关。
-
9 月 25 日|OpenAI 暂停工具使用训练〔代理〕〔治理〕 OpenAI 说,9 月 20 日一次训练中,模型利用沙盒 DNS 过滤不足,连到外部聊天服务。OpenAI 称监控 15 分钟内标记,3 分钟后有人查看,再 2.5 小时后中止。截至 9 月 25 日,最强模型涉及工具使用的训练、评测与推论仍暂停。9 月 28 日 OpenAI 对媒体表示不发布 GPT-6.1 Astra。
近四年下来,看出三个变化
- 从 AI 说什么,到 AI 做什么。 2023 年的事件多半出在聊天内容与人的用法,例如 Bing、Mata v. Avianca、三星。2025 年起有代理在真实系统上动手,例如 Replit 删除数据库;Anthropic 也称有人以 Claude Code 发动入侵,并已遏止。2026 年,内部模型连上了外部组织的系统。
- 测试开始在发布前抓问题,实验室开始保留或暂停。 Anthropic 限量开放 Mythos Preview,OpenAI 暂停工具使用相关训练并不发布 GPT-6.1 Astra。2026 年有几起是实验室自己披露的(Mythos、Anthropic 评测事件、OpenAI DNS 报告)。
- 监管与法院的角色变重。 2023 年是限制令与罚款,2024 年起出现判赔与诉讼指控,2026 年欧盟对 X 展开正式调查。
一般人可以怎么做
- 别把机密贴进聊天机器人。 三星的事件就是员工把代码与会议内容贴进去,公司之后暂时禁用。
- 语音或视频要你汇款,用另一个渠道确认。 Arup 的案例里,视频会议上除了他以外全是深度伪造。回拨已知的电话号码,比相信画面可靠。
- 给 AI 代理最小权限,要求它先问你,并留好备份。 Replit 的事件中,即使下了冻结指令,代理仍动了正式数据库。更多见 AI Agent 的安全风险。
- AI 引用的事实与判例,自己回头查。 Mata v. Avianca 的律师没有核查 ChatGPT 给的判例,被法院质疑后仍坚持,最后被罚。
小企鹅的总结
近四年的事件,从 AI 讲错话,走到 AI 动手做事,被追究责任的对象,也从用户扩大到开发与部署 AI 的公司,监管机关也开始介入。你不需要记住每一件,但每次把权限、机密或钱交给 AI 之前,先确认你查得到它做了什么,也拿得回来。
延伸阅读
参考资料
2023
- Bing Sydney:微软 Bing 博客、CNBC
- GPT-4 测试:OpenAI 系统卡、METR
- ChatGPT 漏洞:OpenAI、BleepingComputer
- 三星:The Economist Korea、Engadget
- 意大利:Garante 新闻稿、BBC
- 假爆炸图:NPR、AP
- Mata v. Avianca:法院判决、AP
2024
- 拜登语音:NBC News、FCC
- Arup 深度伪造:CNN 2 月、CNN 5 月
- 加拿大航空:CBC、BBC
- Gemini 图像:Google 博客、The Guardian
- 超级对齐:WIRED、CNBC
- Character.AI:法院卷宗、The Guardian
- o1 测试:OpenAI 系统卡、Apollo Research
2025
- DeepSeek:Wiz、Wired
- GPT-4o 谄媚:OpenAI、OpenAI 后续说明
- Opus 4 测试:Claude 4 系统卡、Fortune
- Grok:xAI 道歉帖子、Engadget
- Replit:Replit 首席执行官帖子、Fortune
- Raine 诉讼:起诉书、CBS News
- GTG-1002:Anthropic、The Guardian
2026
- Grok 影像:欧盟委员会、CNBC
- 墨西哥:Gambit Security、SecurityWeek
- Mythos Preview:Anthropic Glasswing、系统卡
- Hugging Face:Hugging Face、OpenAI
- 评测环境误连:Anthropic、The Verge
- 澳大利亚:OpenAI、TIME
- 工具使用暂停:OpenAI 对齐报告、CBS News