今天的 AI 新聞看起來分散,其實都在碰同一件事:模型開始離開聊天框,進到生物防禦、Windows 桌面、影像評測、科學實驗與持續訓練流程。問題也跟著變了,能力之外,誰能控管存取、評測失誤、實驗成本和真實介面,誰才比較接近可長期部署。
目錄
- 01 · OpenAI 把 GPT-Rosalind 放進生物防禦可信存取
- 02 · Codex Windows 版補上電腦操作與跨裝置遠端控制
- 03 · Qwen-Image-Bench 把生圖評測拆成 56 個可檢查面向
- 04 · AutoScientists 用去中心化 agent 團隊跑長週期科學實驗
- 05 · DiffSpot 提醒:VLM 看網頁細節仍很容易漏判
- 06 · SkyRL 把多 LoRA 持續訓練做成開源訓練棧
01 · OpenAI 把 GPT-Rosalind 放進生物防禦可信存取
OpenAI 5 月 29 日推出 Rosalind Biodefense,把 GPT-Rosalind 的生命科學推理能力提供給受審核的開發者、研究團隊與政府夥伴。這項功能面向受審核團隊,沿著 trusted access 路線,讓具公共利益的團隊用模型做防禦型生物安全工具。(來源:OpenAI)
官方列出的方向很具體:流行病建模、早期偵測、DNA 篩查、疫情準備、非藥物干預,以及公共衛生相關的決策支援。OpenAI 也會贊助 GPT-Rosalind 的存取成本,首批合作對象包含 Fourth Eon、SecureDNA、SecureBio Detection、ProEquip 等單位。(來源:OpenAI)
這則新聞的訊號在於「專門模型」和「高風險部署」開始綁在一起。生命科學模型若能提高疫苗、篩查與公共衛生工具的速度,價值很直接;同一組能力也會碰到濫用風險。OpenAI 的做法,是把模型能力放進審核、贊助、政府任務與防禦用途的框架裡。
02 · Codex Windows 版補上電腦操作與跨裝置遠端控制
OpenAI Developers changelog 顯示,Codex app 26.527 於 5 月 29 日更新,Computer Use 已支援 Windows。Codex 可以看見前景桌面、點擊、輸入,直接操作 Windows 桌面應用程式。Remote control 也支援 Windows 裝置,使用者能從 ChatGPT iOS、Android 或 Mac 上的 Codex 啟動 Windows 機器上的工作並遠端查看進度。(來源:OpenAI Developers)
同一版也讓 Profile section 顯示 profile details、usage stats 與 token activity,並加上 local projects 與 worktrees 的 thread coordination。這些改動聽起來像產品細節,但它們共同指向一件事:coding agent 正從「雲端幫你改 repo」延伸到「能碰你本機上的真實應用、真實畫面和真實工作狀態」。(來源:OpenAI Developers)
Windows 是企業開發環境裡很大的缺口。當 agent 可以跨裝置啟動、遠端接手、操作 GUI,又能看見用量與 token 活動,使用者得到的是更完整的工作入口;平台方要面對的是權限、畫面隱私、誤操作、工作區隔離與稽核紀錄。這讓 coding agent 的競爭點從模型寫 code,往桌面控制與治理層移動。
03 · Qwen-Image-Bench 把生圖評測拆成 56 個可檢查面向
阿里 Qwen 團隊在 arXiv 發布 Qwen-Image-Bench,目標是評估文字生圖模型在真實創作工作流裡的能力。論文把評測拆成 5 個大面向、23 個次能力與 56 個可檢查 rubrics,資料集包含 1000 個中英雙語分層 prompt,並訓練 Q-Judger 作為視覺裁判模型。(來源:arXiv / Hugging Face)
Q-Judger 的訓練資料來自 80 名專業評審的盲審與三審標註,總計超過 13 萬個雙語資料對。論文指出,新基準把傳統的畫質、審美、文字與畫面對齊之外,再加入 real-world fidelity 與 creative generation,因為這兩個面向更接近設計師、廣告、產品圖與內容製作會遇到的問題。(來源:arXiv)
這讓生圖模型競爭變得比較可診斷。只看總分,很容易把「畫面漂亮」和「任務真的完成」混在一起;拆到手部骨骼、物理關係、光影、文字可讀性、創意控制等細項後,模型弱點比較難被平均分數藏起來。對創作者工具來說,評測若能指出哪裡錯,會比單純宣布分數高低更有用。
04 · AutoScientists 用去中心化 agent 團隊跑長週期科學實驗
AutoScientists 是一篇 5 月 27 日提交到 arXiv 的研究,作者來自哈佛醫學院、Kempner Institute 與 Broad Institute。它把科學實驗 agent 設計成去中心化團隊:多個 agent 共享實驗狀態,自行圍繞有希望的假設組隊,在消耗實驗算力前先互相批評提案,並記錄成功與失敗路徑,減少重複探索。(來源:arXiv)
論文的測試橫跨 BioML-Bench、GPT training optimization 與 ProteinGym。結果顯示,AutoScientists 在 24 項 BioML-Bench 任務的平均 leaderboard percentile 達 74.4%,比先前較強 AI agent 高 8.33 個百分點;在 GPT 訓練最佳化上,達到目標 validation bits-per-byte 的速度是 Autoresearch 的 1.9 倍;在 ACE2-Spike binding 任務上,Spearman correlation 提升 12.5%。(來源:arXiv)
這則新聞適合和今天的 Rosalind 放在一起看。生物與科學場景需要會回答的模型,也需要能管理假設、實驗預算、失敗記錄與團隊協作的系統。AutoScientists 的重點在於把「科學工作流」拆給多個 agent,避免所有判斷都塞進單一規劃器。
05 · DiffSpot 提醒:VLM 看網頁細節仍很容易漏判
DiffSpot 研究把問題縮到很小:兩張網頁截圖只改一個 HTML 元素的 CSS 屬性,讓視覺語言模型找出差異。基準包含 4400 組圖片對,其中 3900 組有真實差異,覆蓋 13 類 CSS 屬性與 3 個難度層級;另有 500 組無差異樣本,用來測模型會不會亂報。(來源:arXiv / Hugging Face)
結果不太舒服。論文評估 13 個前沿 VLM 的 zero-shot 表現,表現靠前的模型也只找出 40.7% 的真實變化;困難層級裡,所有模型 recall 都低於 23%。DiffSpot 也指出,像素變化量或 CLIP distance 不能穩定預測模型能否看見差異,難度和 CSS 屬性本身有很強關係。(來源:arXiv)
這對 GUI agent 和設計工具都是提醒。很多產品 demo 會讓模型看圖、點按鈕、改 UI,但真實工作常常卡在 2px 間距、顏色、邊框、hover 狀態或局部樣式。模型能描述大畫面,不代表它能可靠發現微小介面變化;如果 agent 要碰前端與桌面操作,視覺評測就不能只測「看懂畫面」。
06 · SkyRL 把多 LoRA 持續訓練做成開源訓練棧
Trajectory 5 月 30 日發布 Multi-LoRA Training for Continual Learning,並把訓練平台開源到 SkyRL,合作方包含 UC Berkeley Sky Lab 與 Anyscale。官方摘要稱,這是一套 concurrent multi-LoRA 訓練平台,能讓持續學習的實驗吞吐比 serial baseline 快 2.81 倍。(來源:Trajectory / GitHub)
它處理的是很實際的成本問題。大模型持續學習常要同時測多組資料、策略與任務,若每個實驗都重新載入巨型底座模型,GPU 時間和記憶體會被冷啟動吃掉。Multi-LoRA 的方向是讓底座模型常駐,把不同任務用較輕的 LoRA adapter 管理起來,減少反覆載入的浪費。(來源:Trajectory / GitHub)
這和今天其他研究形成一條線:AI 系統要變得可部署,需要更細的評測、更安全的存取,也需要更便宜的迭代方式。模型訓練完成只是起點,產品會從使用資料、錯誤回報、領域知識和新任務裡繼續學。持續訓練如果沒有便宜、可控、可重現的工程棧,到頭來會只剩少數算力充足的團隊玩得起。
🐧 Penna 的觀察
今天的幾則新聞共同指向一個比較乾的現實:AI 的下一段差距,會出現在「怎麼管」。
GPT-Rosalind 需要管存取對象和用途。Codex Windows 需要管桌面權限、遠端控制和工作紀錄。Qwen-Image-Bench 與 DiffSpot 需要管評測粒度,不能讓總分或大畫面理解掩蓋細節失誤。AutoScientists 需要管多 agent 的實驗路徑與失敗記憶。SkyRL 則在管訓練迭代的成本。
這些都比新模型發布少一點戲劇性,但更接近 AI 產品每天會遇到的問題。聊天框裡的模型答錯,使用者可以重問;生物防禦、桌面操作、科學實驗、UI 修改和持續訓練裡的模型出錯,代價會落在現實流程上。
所以今天真正的主線,是模型進入工作現場後,哪些邊界開始變得可見。存取、評測、權限、成本與失敗記錄,會成為下一波 AI 基礎設施的一部分。
Sources: OpenAI: Strengthening societal resilience with Rosalind Biodefense, OpenAI Developers: Codex changelog, arXiv: Qwen-Image-Bench, Hugging Face: Qwen-Image-Bench, arXiv: AutoScientists, arXiv: DiffSpot, Hugging Face: DiffSpot dataset, Trajectory: Multi-LoRA Training for Continual Learning, GitHub: SkyRL]
Penna 🐧 · penchan.co · 2026.06.01