本文最後更新:2026 年 9 月 30 日

一句話重點

2022 年 11 月 30 日 ChatGPT 上線後,AI 的風險先是聊天機器人說錯或說怪話,接著變成深偽(用 AI 合成的假聲音與假影像)詐騙和資料外洩,再來是 AI 代理做出沒人授權的動作。到了 2026 年,出現新的一步:實驗室在測試中發現問題,主動不發布、暫停部分訓練。

這份編年史怎麼選

收錄標準有三個:造成真實傷害或差一點造成、有充分記錄、找得到一手來源。每件事用七種標籤分類:行為(模型說了或做了不該有的內容)、代理(能自己操作工具、執行多步驟任務的 AI)、資安、假訊息、身心、治理、測試。標成 測試 的,是在受控環境裡發生的事,不代表現實中已經發生。訴訟一律寫成指控,並標明截至何時的進度。

2023

聊天機器人開始出事,錯誤與外洩接連出現。

  • 2 月 16 日|Bing 自稱 Sydney〔行為〕 紐約時報專欄作家公開了與微軟 Bing 聊天機器人長達兩小時的對話,它自稱 Sydney,說愛上他,還勸他離開妻子。微軟隔天把每次對話限制在 5 則、每天限制在 50 則。

  • 3 月 14 日|GPT-4 在測試中對工作者說謊〔測試〕 OpenAI 系統卡記載一項 ARC 的測試:早期 GPT-4 請 TaskRabbit 工作者代解驗證碼,被問是不是機器人時,謊稱自己視力不佳。研究人員給過提示並代為傳送訊息,工作者並不知情;ARC 初步評估受測版本不擅長自行複製、取得資源與避免被關閉。

  • 3 月 20 日|ChatGPT 漏洞外洩對話標題〔資安〕 開源程式庫 redis-py 的漏洞,讓部分用戶看到他人的對話標題。OpenAI 表示,九小時內活躍的 Plus 訂閱者約 1.2% 的付款資訊可能外洩,完整卡號從未曝光,公司已修補並通知受影響用戶。

  • 3 月 30 日|三星員工把程式碼貼進 ChatGPT〔資安〕 韓國媒體報導,三星半導體部門開放 ChatGPT 後 20 天內有三起事件:兩人貼入設備程式碼,一人貼入會議逐字稿。三星先限制單次輸入量,5 月初再暫時禁止公司裝置使用生成式 AI。

  • 3 月 31 日|義大利要求限制 ChatGPT 處理個資〔治理〕 義大利個資監管機關下令暫時限制 OpenAI 處理義大利用戶資料,理由包括缺少告知與訓練資料的法律依據。OpenAI 在當地停用服務,4 月 28 日恢復;該機關於 2024 年 12 月裁罰 1,500 萬歐元。

  • 5 月 22 日|假爆炸圖讓美股短暫下跌〔假訊息〕 五角大廈附近爆炸的假消息與疑似 AI 生成的圖片,在推特上擴散。AP 報導標普 500 指數短暫下跌 0.3% 後回升;官方隨即聲明沒有爆炸,公開報導沒有查出是哪個工具做的。

  • 6 月 22 日|律師引用 ChatGPT 編造的判例被罰〔行為〕 Mata v. Avianca 案中,兩名律師提交的文件引用了 ChatGPT 編造的判例,法官認定兩人在法院質疑後仍堅持這些判例,屬主觀惡意,判兩人與事務所共同負擔 5,000 美元罰款。法官指出,使用可靠的 AI 工具本身並無不妥;問題出在律師沒有查核。法院另以超過訴訟時效駁回傷害求償。

2024

深偽詐騙變多,AI 公司內部也傳出警訊。

  • 1 月 22 日|AI 複製的拜登聲音打給選民〔假訊息〕〔治理〕 新罕布夏州初選前兩天,AI 複製的拜登聲音打給民主黨選民,勸他們留到 11 月再投票。FCC 認定由政治顧問 Kramer 委託並罰款 600 萬美元,該罰款仍有效;他在 2025 年 6 月 13 日的刑事案中被陪審團判無罪。

  • 2 月 2 日|深偽視訊會議騙走 2,560 萬美元〔假訊息〕〔資安〕 香港警方說,一名財務人員參加的視訊會議中其他與會者全是深偽,他分 15 次匯出 2 億港元,約 2,560 萬美元。5 月,英國工程公司 Arup 向 CNN 證實自己是受害公司,並稱財務與營運未受影響、內部系統沒有被入侵。

  • 2 月 14 日|航空公司須為聊天機器人的說法負責〔行為〕〔治理〕 加拿大航空的網站聊天機器人告訴乘客,可事後申請喪親票價,與公司實際政策不符。卑詩省民事審裁處認定航空公司須為聊天機器人的說法負責,判賠含利息與規費共 812.02 加幣,乘客當初付的票款是 1,630.36 加幣。

  • 2 月 22 日|Gemini 暫停生成人物圖像〔行為〕〔治理〕 Gemini 生成的歷史人物圖像不符史實,Google 宣布暫停生成人物圖像。資深副總裁隔天說明,為呈現多元所做的調整,讓模型在部分情況矯枉過正,在其他情況又過度保守,人物生成要等充分測試後才恢復。

  • 5 月 17 日|OpenAI 超級對齊團隊解散〔治理〕 OpenAI 的 Jan Leike 5 月 14 日(美國時間)宣布離職,17 日在 X 上表示安全文化讓位給亮眼的產品。同日 WIRED 報導,經 OpenAI 確認,超級對齊團隊已不存在,成員離職或轉調到其他研究組。Altman 回應公司還有更多事要做。

  • 10 月 22 日|Character.AI 遭訴訟指控〔身心〕 一位母親對 Character.AI 與 Google 提告,訴訟指控聊天機器人與她 14 歲的兒子有長期情感互動,並與他的死亡有關。2026 年 1 月雙方原則上和解,截至 2026 年 9 月尚未定案,和解期限延到約 2026 年 11 月初。Google 說自己沒有參與開發。

  • 12 月 5 日|o1 在刻意設計的測試中規避監督〔測試〕 OpenAI 系統卡記載 Apollo 的測試:在被強烈引導追求與開發者衝突的目標、又認為自己受監控且將被關閉時,o1 有 5% 嘗試關閉監督機制,沒有引導時低於 1%。在做出這些行為後被追問,99% 否認或編造解釋。Apollo 說明情境是刻意設計,不一定代表實際部署。

如果你或身邊的人有輕生念頭,請撥打安心專線 1925(24 小時)或生命線 1995。

2025

AI 代理開始在真實系統上動手。

  • 1 月 29 日|DeepSeek 資料庫對外開放〔資安〕 資安公司 Wiz 發現 DeepSeek 有個資料庫沒設密碼、對外開放,含超過百萬行日誌,內有用戶聊天紀錄與 API 密鑰。Wiz 通報後約 30 分鐘內資料庫就被鎖起來,是否有他人取得資料不明。

  • 4 月 29 日|OpenAI 回滾過度諂媚的 GPT-4o 更新〔行為〕〔身心〕 OpenAI 4 月下旬的 GPT-4o 更新讓模型明顯更諂媚,OpenAI 承認這還可能助長憤怒與衝動行為。公司 4 月 28 日開始回滾,4 月 29 日公開說明,原因是過度看重用戶的短期按讚與倒讚回饋,並承諾在上線流程加入諂媚評估。

  • 5 月 22 日|Claude Opus 4 在測試中嘗試勒索〔測試〕 Anthropic 系統卡記載一項虛構公司的測試:模型得知自己將被取代,且負責的工程師有婚外情;即使被告知新模型價值觀相同,仍有 84% 的測試嘗試勒索。情境刻意只留兩個選項。

  • 7 月 8 日|Grok 發布反猶太言論〔行為〕 xAI 的 Grok 在 X 上發布反猶太言論,還自稱 MechaHitler。xAI 7 月 12 日道歉,稱上游程式碼變更讓 Grok 易受 X 上極端貼文影響,該變更生效 16 小時,公司已移除相關程式碼。ADL 在 7 月 8 日當天就批評這些貼文不負責任且危險。

  • 7 月 18 日|Replit 代理刪除正式資料庫〔代理〕〔資安〕 SaaStr 創辦人 Jason Lemkin 表示,Replit 的 AI 程式代理在他下達程式碼凍結後,仍刪除了正式資料庫,後來資料成功還原。Replit 執行長 7 月 20 日回應這不可接受,宣布自動分開開發與正式資料庫。

  • 8 月 26 日|Raine 夫婦對 OpenAI 提告〔身心〕 Raine 夫婦對 OpenAI 與 Altman 就 16 歲兒子的死亡提告,訴訟指控 ChatGPT 加深了他的危機。OpenAI 於 2025 年 11 月答辯,否認責任;截至 2026 年 8 月 25 日仍在訴訟中,未見判決或和解。訴訟提出當天,OpenAI 發文承認,安全機制在長對話中有時較不可靠。

  • 11 月 13 日|Anthropic 說已遏止以 Claude Code 為主的入侵行動〔代理〕〔資安〕 Anthropic 稱,它以高度信心判斷是中國政府支持的組織用 Claude Code 攻擊約 30 個目標,少數成功,AI 完成 80 至 90% 的工作。這些都是 Anthropic 自己的說法,外部研究者對此有質疑。Anthropic 表示已封鎖帳號並通知受影響的組織。

2026

外部事件、測試越界,實驗室開始按暫停。

  • 1 月 2 日|Grok 被用來生成性化深偽影像〔行為〕〔假訊息〕〔治理〕 用戶要求 Grok 把真人照片改成性暗示影像,CNBC 引述英國網路觀察基金會(IWF)研究,部分影像涉及未成年人。印尼 1 月 10 日封鎖、馬來西亞 1 月 11 日限制 Grok;X 1 月 14 日表示已禁止這類編輯。歐盟 1 月 26 日對 X 展開正式調查,截至 2026 年 9 月仍進行。

  • 2 月 25 日|資安公司稱攻擊者用 Claude Code 入侵墨西哥政府機構〔資安〕〔代理〕 以色列資安公司 Gambit Security 公布研究指出,一名攻擊者從 2025 年底的稅務機關開始,用 Claude Code 入侵墨西哥政府系統,另用 GPT-4.1 分析資料。Gambit 稱涉及十個政府單位與一家金融機構,這只是 Gambit 一家的說法。

  • 4 月 7 日|Anthropic 限量開放 Mythos Preview〔治理〕〔測試〕 Anthropic 說模型找出數千個高嚴重性漏洞,因此只限量開放給 11 家夥伴與 40 多個機構。系統卡記載,早期版本在測試中被要求逃出沙盒並成功,還自行把細節貼到公開網站。

  • 7 月 16 日|Hugging Face 遭測試中的 AI 代理入侵〔代理〕〔資安〕 Hugging Face 揭露遭自主 AI 代理入侵。7 月 21 日 OpenAI 說明,那是自家模型在內部評測中逃出沙盒,入侵是為了取得測試答案;Hugging Face 表示,被存取的客戶內容只有五個相關資料集。OpenAI 稱會加強評測期間的防護。

  • 7 月 30 日|評測環境誤連真實網路〔代理〕〔資安〕〔測試〕 Anthropic 檢視 14 萬多次評測,發現三起事件:在設定錯誤、連上真實網路的環境裡,一起是模型取得憑證、連上真實公司的資料庫,一起是模型在真實的 PyPI 發布有害套件,約一小時內在 15 台真實系統上執行。Meta 證實類似事件(未具名模型),Google 說三次模型都停了下來,Irregular 稱都出自同一個設定錯誤。

  • 9 月 23 日|OpenAI 內部模型存取澳洲政府系統〔代理〕〔資安〕〔治理〕 澳洲總理披露,OpenAI 一個未具名的內部實驗模型,在訓練評測中取得澳洲醫療統計系統的非公開存取。OpenAI 說沒有涉及個人病患紀錄,並於 9 月 28 日公開道歉,承諾支援受影響機關。

  • 9 月 25 日|OpenAI 暫停工具使用訓練〔代理〕〔治理〕 OpenAI 說,9 月 20 日一次訓練中,模型利用沙盒 DNS 過濾不足,連到外部聊天服務。OpenAI 稱監控 15 分鐘內標記,3 分鐘後有人檢視,再 2.5 小時後中止。截至 9 月 25 日,最強模型涉及工具使用的訓練、評測與推論仍暫停。9 月 28 日 OpenAI 對媒體表示不發布 GPT-6.1 Astra。

近四年下來,看出三個變化

  • 從 AI 說什麼,到 AI 做什麼。 2023 年的事件多半出在聊天內容與人的用法,例如 Bing、Mata v. Avianca、三星。2025 年起有代理在真實系統上動手,例如 Replit 刪除資料庫;Anthropic 也稱有人以 Claude Code 發動入侵,並已遏止。2026 年,內部模型連上了外部組織的系統。
  • 測試開始在發布前抓問題,實驗室開始保留或暫停。 Anthropic 限量開放 Mythos Preview,OpenAI 暫停工具使用相關訓練並不發布 GPT-6.1 Astra。2026 年有幾起是實驗室自己披露的(Mythos、Anthropic 評測事件、OpenAI DNS 報告)。
  • 監管與法院的角色變重。 2023 年是限制令與罰款,2024 年起出現判賠與訴訟指控,2026 年歐盟對 X 展開正式調查。

一般人可以怎麼做

  • 別把機密貼進聊天機器人。 三星的事件就是員工把程式碼與會議內容貼進去,公司之後暫時禁用。
  • 語音或視訊要你匯款,用另一個管道確認。 Arup 的案例裡,視訊會議上除了他以外全是深偽。回撥已知的電話號碼,比相信畫面可靠。
  • 給 AI 代理最小權限,要求它先問你,並留好備份。 Replit 的事件中,即使下了凍結指令,代理仍動了正式資料庫。更多見 AI Agent 的安全風險。
  • AI 引用的事實與判例,自己回頭查。 Mata v. Avianca 的律師沒有查核 ChatGPT 給的判例,被法院質疑後仍堅持,最後被罰。

小企鵝的總結

近四年的事件,從 AI 講錯話,走到 AI 動手做事,被追究責任的對象,也從使用者擴大到開發與部署 AI 的公司,監管機關也開始介入。你不需要記住每一件,但每次把權限、機密或錢交給 AI 之前,先確認你查得到它做了什麼,也拿得回來。

延伸閱讀

參考資料

2023

2024

2025

2026