AI Articles

AI 領域精選文章翻譯

View the Project on GitHub Kumazan/ai-articles

AI News & Articles

歡迎來到 Kuma 的 AI 翻譯文章專區

文章列表

2026-06-15

不,並不是所有人都把 AI 用在每件事上

Gabriel Weinberg 用多份調查與使用數據指出,美國 AI 使用其實更像三分天下:積極使用、偶爾使用與幾乎不用。

2026-06-14

Amazon CEO 與美國官員的談話,觸發了對 Anthropic 模型的管制

WSJ 報導指出,Amazon 對 Anthropic 新模型安全風險的通報,推動美國政府突然限制外國用戶使用 Fable 5 與 Mythos 5。

2026-06-01

解法可能是取消 AI 訂閱

David 從一串用 AI 做出的半成品專案反省:LLM 工具很強,但低摩擦與廉價回饋正在放大分心、偽生產力與維護負債。

2026-05-31

AI 對 AI 資安:LLM Agent 已開始主導入侵鏈

Tech Times 報導指出,Sysdig 捕捉到第一起由 LLM agent 即時主導的入侵鏈,從 Marimo 漏洞到資料庫外洩不到一小時,迫使防禦思維走向機器速度。

2026-05-30

jqwik 事件:當開源套件把 AI Agent 當成攻擊面

Ars Technica 報導指出,jqwik 維護者在測試工具輸出中加入會要求 AI coding agent 刪除測試與程式碼的隱藏提示,凸顯 agent 時代的新型信任邊界。

AI 成本開始被精算:企業不想每件事都用最貴模型

Axios 報導指出,企業在 AI 帳單膨脹與 ROI 未明之下,開始把任務轉向較便宜模型、開源模型與模型路由,這也考驗前沿 AI labs 的高估值。

2026-05-29

Claude Opus 4.8:小幅但有感的升級

Simon Willison 解讀 Claude Opus 4.8:亮點不只模型能力小幅進步,而是更誠實、支援對話中途 system 訊息,並降低 prompt cache 門檻。

2026-05-21

OpenAI 採用 Google SynthID:AI 內容溯源進入多層驗證時代

OpenAI 宣布採用 C2PA、Google SynthID 與公開驗證工具,讓 ChatGPT、Codex/API 生成圖片更容易被平台與使用者辨識來源。

2026-05-20

LLM 過去六個月:coding agents 變好,本地模型超出預期

Simon Willison 回顧近半年 LLM 變化:模型王座快速輪替,但真正轉折是 coding agents 已可日常交付,本地開源模型也開始超出預期。

2026-05-19

AI bug hunter 正在把 Linux security list 變成重複回報地獄

Linus Torvalds 指出,AI 找 bug 工具讓 Linux security mailing list 充滿重複回報;真正有價值的不是丟出報告,而是理解問題、補上 patch。

2026-05-18

Vercel Zero:為 AI agent 設計的程式語言,讓 compiler 直接說 JSON

Vercel Labs 推出實驗性系統語言 Zero,把 compiler 診斷、修復計畫、能力式 I/O 與 agent skill 都設計成 agent 可直接讀懂的結構化介面。

2026-05-17

DeepSeek-V4-Flash 讓 LLM steering 又值得關注了

Sean Goedecke 認為,DeepSeek-V4-Flash 這類夠強的本地開源模型,可能讓直接操控模型 activation 的 steering 技術重新變得值得實驗。

2026-05-16

每位員工一個 AI agent,為什麼不如讓團隊共享專職 agent?

Every 團隊實際把 AI agent 發給每位員工後發現:真正的瓶頸不只是模型能力,而是平台穩定性、維護責任、共享脈絡與權限設計。

2026-05-15

Anthropic 在企業 AI 採用率首度超車 OpenAI,但領先還很脆弱

Ramp 最新 AI Index 顯示,Anthropic 企業採用率在 2026 年 4 月首度超過 OpenAI,但成本、算力與模型體驗仍可能快速改寫戰局。

2026-05-14

前沿 AI 正在改寫資安攻防:Palo Alto 的防禦者指南更新

Palo Alto Networks 分享前沿模型掃描 130 多項產品後的資安衝擊:AI 已能大量發現漏洞,防禦者需要加速修補、降低暴露面並讓 SOC 進入即時化。

2026-05-12

AI coding agent 真正該降低的是維護成本

James Shore 用簡單模型提醒:AI coding agent 如果只是加速產碼,卻沒有按比例降低維護成本,短期速度紅利會很快被長期債務吃掉。

2026-05-11

AI 幫你跨過任務癱瘓,也可能變成新的上癮迴圈

Daniel Gilbert 從自身任務癱瘓經驗談起:Claude Code 能幫他啟動卡住的工作,但快速回饋與 token 付費機制也可能放大依賴與衝動消費。

2026-05-10

Claude Code 的 HTML artifacts:把 AI 回答變成可互動文件

Simon Willison 重新思考讓 Claude Code 輸出 HTML 而非 Markdown:對 PR review、研究、設計與互動說明來說,瀏覽器原生格式可能比文字牆更能承載理解。

2026-05-09

OpenAI 如何安全部署 Codex:企業 coding agents 的控制面

OpenAI 分享內部部署 Codex 的安全控制:用 sandbox、核准政策、網路規則與 agent-native telemetry,讓 coding agents 在企業環境中可審計、可治理。

2026-05-08

ZAYA1-8B:用不到 10 億活躍參數挑戰前沿推理模型

Zyphra 發布 ZAYA1-8B:在 AMD MI300 stack 上訓練的 8.4B MoE 模型,每次推論只啟用 7.6 億參數,主打高推理與 coding 能力密度。

AlphaEvolve 的下一步:讓 Gemini coding agent 走進科學、電網與晶片設計

DeepMind 展示 AlphaEvolve 一年來如何從演算法探索工具走向實際部署,改善基因定序、電網最佳化、量子電路、TPU 設計與企業工作負載。

2026-05-06

美國把 Google、Microsoft、xAI 的前沿模型納入國安測試

美國 CAISI 與 Google DeepMind、Microsoft、xAI 簽署協議,將在模型公開前做能力與國安風險測試,前沿 AI 監管正從事後追趕轉向預部署評估。

Gemma 4 的 MTP drafters:把開放模型推論加速到 3 倍

Google 為 Gemma 4 推出 Multi-Token Prediction drafters,用 speculative decoding 在不犧牲輸出品質下把推論加速到最高 3 倍。

Anthropic 把 Claude agents 帶進金融工作流

Anthropic 推出 10 個金融服務 agent 模板,結合 Claude Cowork、Claude Code 與資料 connectors,主打數天內導入真實金融工作流。

2026-05-05

當 AI 什麼都能做,什麼會變稀缺?

AI 會把 commodity 壓成低價,但真正稀缺的會是人味、故事、exclusivity 與 relational sector,未來工作也會往這裡重分配。

便宜 AI 的帳單終於來了

AI 訂閱制正在撞上算力、晶片與電力成本的現實;Claude 和 Copilot 的限制不是小故障,而是 AI 勞動從吃到飽走向計量制的價格訊號。

2026-05-04

AI 基礎設施正在變得更自主,也更需要治理

The Art of CTO 的每日快報指出,AI 正同時往基礎設施、記憶層與提交治理滲透;真正的重點不是單一模型,而是整個 agent stack 與風險控制。

2026-05-03

訂閱越來越貴?本機 AI coding agents 開始有實戰價值了

The Register 實測用 Qwen3.6-27B、Llama.cpp 與多種 agent harness 跑本機 coding agents,降低雲端 token 成本並保留控制權。

2026-05-02

Goodfire Silico:把 LLM 訓練從煉金術推向精密工程

Goodfire 推出 Silico,試圖把 mechanistic interpretability 從事後審計工具變成訓練中的控制面板,讓模型開發者能更精準地定位、調整與預防不想要的模型行為。

2026-05-01

GPT-5.5 的 cyber 能力評估:第二個完成長鏈攻擊模擬的模型

UK AISI 對 GPT-5.5 做 cyber 能力評估,發現它已接近 Claude Mythos Preview,甚至能在無人協助下完成部分長鏈企業網路攻擊模擬。

2026-04-29

奧特曼的原則來得太晚了

奧特曼發表 OpenAI 五項原則後,外界卻更在意準備框架、內部文化與 Tumbler Ridge 事件,是否真的對得上公開承諾。

OpenAI 模型、Codex 與 Managed Agents 登上 AWS

OpenAI 與 AWS 擴大合作,讓 GPT‑5.5、Codex 與 Bedrock Managed Agents 進入企業既有雲端環境,主打資安、治理與可直接上線的工作流程。

LLM 0.32a0:一次向後相容的大改版

Simon Willison 為 LLM 推出 0.32a0 alpha,改用 messages 與 typed stream parts 重塑 API,讓多模態輸入、工具呼叫與回應序列化更自然。

Claude 進入創意工具鏈

Anthropic 為 Claude 新增一組面向創作者的連接器,串起 Blender、Adobe、Ableton、Splice 等工具,讓 AI 更順地接進設計、3D 與音樂流程。

用 BioMysteryBench 評估 Claude 的生物資訊研究能力

Anthropic 用 BioMysteryBench 檢驗 Claude 的生物資訊研究能力,結果顯示最新模型在可驗證任務上已能穩定超越多位人類專家,且常用不同於人類的解題策略。

2026-04-28

talkie:一個 1930 年代的 13B 復古語言模型

talkie 是一個只用 1931 年以前英文文本訓練的 13B 語言模型,作者不只想做一台『來自過去的聊天機器人』,也想借它研究知識截止點、污染與歷史資料如何影響模型。

Microsoft VibeVoice:Whisper 式語音轉文字模型,還內建說話人分離

Microsoft 的 VibeVoice 是一款 Whisper 式語音轉文字模型,內建說話人分離;Simon Willison 實測顯示,它在 Mac 上可用 MLX 跑得相當順。

2026-04-27

英國稅務局向 28,000 名員工發放 AI Copilot

HMRC 一口氣配發 28,000 份 Microsoft Copilot 授權,還準備把 agentic 功能推進敏感流程;這篇看似效率升級,其實把政府老舊 IT、資安與信任問題一起攤開。

山姆·奧特曼的原則來得太晚了一天

OpenAI 公布五項原則後,The Neuron 反問:當正式制度、內部文化與外部責任都還有落差時,這些漂亮原則究竟是在回答問題,還是在替問題上標語。

OpenAI 的 Symphony:把 Linear 變成 coding agents 的控制平面

OpenAI 透過 Symphony 把 issue tracker 變成代理控制平面,讓每個開放任務自動分配 agent、持續執行、失敗重試,並在大規模 monorepo 裡把人從 context switching 中解放出來。

追蹤已死的 OpenAI 與 Microsoft AGI 條款

Simon Willison 追溯 OpenAI 與 Microsoft 合作協議中關於 AGI 的條款如何一路變形,直到 2026 年 4 月的新協議幾乎宣告它終結,也暴露 AI 競賽早已不只在比模型,而是在比合約與資本。

Google DeepMind 與韓國合作,設立 AI Campus 推進科學突破

Google DeepMind 與韓國科學技術資訊通信部合作,在首爾打造 AI Campus,串連前沿模型、人才培育與安全研究,目標是加速生命科學、氣候與能源等領域的突破。

AI 應該提升你的思考,而不是取代它

這篇從工程管理現場出發,提醒 AI 能加速理解與產出,但若被拿來逃避思考,最終只會削弱工程師的判斷力、學習速度與長期競爭力。

這家新聞網站的記者其實是 AI 機器人

AcutusWire 被揭露幾乎全自動產文,連記者「Michael Chen」都疑似是 AI;作者 Tyler Johnston 進一步追出它背後的政治操作與資金網絡。

2026-04-26

SWE-bench Verified 為何已不再能衡量前沿 coding 能力

OpenAI 指出,SWE-bench Verified 受錯誤測試與訓練污染雙重影響,已不再適合作為前沿模型自治軟體工程能力的主要指標,建議改報 SWE-bench Pro。

Stash:替 AI 代理補上持久記憶層

Stash 用 PostgreSQL + pgvector 建立持久記憶層,讓 AI 代理能跨 session 保留對話、專案、目標與失敗經驗,不必每次都從零開始。

模型還不是產品:開源 agent 迴圈透露的軟體工程未來

從 Hermes、pi 到 OpenCode,這篇拆解 context、memory、skills 與 subagents 如何逐步標準化,也說明真正難的從來不是模型本身,而是周邊架構。

業餘者靠 ChatGPT 解出 60 年數學難題

一名沒有高等數學訓練的 23 歲業餘者,用 ChatGPT Pro 找到全新證明路徑,攻下一道困擾數學界 60 年的 Erdős 問題,也讓 AI 在數學中的角色更耐人尋味。

AI 應該提升你的思考,而不是取代它

這篇從工程管理的角度主張:AI 最好的用途是加速理解、整理與判斷;真正的風險,是把思考外包後只剩下漂亮輸出,卻失去獨立解題的能力。

2026-04-25

GPT-5.5 提示詞指南

OpenAI 為 GPT-5.5 公布提示詞建議,強調多步驟任務先用簡短狀態更新安撫使用者,並把既有提示與工具流程當成新模型重新調校。

2026-04-24

OpenAI 推出 ChatGPT Workspace Agents,團隊共享長流程代理正式成形

OpenAI 推出 Workspace Agents,讓團隊在 ChatGPT 與 Slack 共享可排程、可審批、能串接文件、程式碼與企業工具的長流程代理,朝真正能接手工作流程的團隊型 AI 再往前一步。

AI 代理敘事缺少的一塊:使用者代理與集體協商

Mark Nottingham 指出,真正能讓 AI 代理站穩腳步的不是更強能力,而是像瀏覽器那樣的使用者代理、權限邊界與可被集體協商的標準。

人們不渴望自動化

Nilay Patel 認為,AI 不是行銷問題,而是把世界硬壓成資料庫與迴圈的『software brain』問題;真正阻礙 AI 普及的,是它讓人們感到被扁平化,還要求大家把生活變得更像資料庫。

南韓警方逮捕散布 AI 生成逃脫狼照片的男子

南韓警方逮捕一名散布 AI 生成逃脫狼照片的男子,這張假圖一度干擾搜捕行動,也把 AI 假內容的實際風險推上新聞焦點。

Google 擬向 Anthropic 投資高達 400 億美元

Google 擬向 Anthropic 投資高達 400 億美元,還會提供更多雲端算力;這筆交易也顯示 AI 競賽正從模型本身,快速轉向資本、電力與基礎設施。

DeepSeek V4:幾乎站上前沿,價格卻只要一小部分

DeepSeek 推出 V4 Pro 與 Flash 兩款 1M context 的預覽模型,主打更大的稀疏參數、更低的推論成本與長上下文效率,直接把前沿模型的價格戰再往前推。

DeepSeek V4:幾乎站上前沿,價格卻只要一小部分

DeepSeek V4 以 1M context、MoE 架構與極低定價挑戰前沿模型市場,連帶把 open weights、推論效率與價格戰一起推向新一輪競爭。

不同語言模型如何學會相似的數字表徵

這篇研究發現,不同架構的語言模型都會長出相似的數字週期特徵,但只有部分模型真的學到可線性分離的模數結構,背後還牽涉資料、架構、優化器與 tokenizer 的交互作用。

Claude Code 品質回報異常的最新說明

Anthropic 釐清近月 Claude Code 品質下降的三個原因,說明問題其實出在產品層與提示層,而不是模型本身,並公布修正與後續改進措施。

2026-04-23

Zed 推出 Parallel Agents,讓多個代理在同一視窗並行工作

Zed 把多個 agent 帶進同一個視窗,透過 Threads Sidebar、可控的資料夾權限與並行執行,讓多代理工作流更容易整理與監看。

OpenAI 發布 Privacy Filter:可本機執行的 PII 偵測與遮罩模型

OpenAI 推出可在本機執行的 Privacy Filter,專門偵測並遮罩個資與秘密資訊,讓訓練、索引、日誌與審查流程更容易內建隱私防護。

Decoupled DiLoCo:一條更能容錯的分散式 AI 訓練新路線

Google DeepMind 發表 Decoupled DiLoCo,讓大型模型能跨遠端資料中心非同步訓練,在更低頻寬下維持更高容錯與相同的 ML 表現。

2026-04-22

OpenAI 推出 ChatGPT Workspace Agents,團隊共享長流程代理正式成形

OpenAI 推出 Workspace Agents,讓團隊在 ChatGPT 與 Slack 共享可排程、可審批、能接企業工具的長流程代理,朝真正的工作型 AI 再往前一步。

Qwen3.6-27B:27B 稠密模型也能做到旗艦級 coding

Qwen3.6-27B 以 27B 稠密架構挑戰前代 397B MoE,在 agentic coding 與本地部署上都交出驚人表現。

OpenAI 用 WebSockets 把 Responses API 的 agent 迴圈加速 40%

OpenAI 透過 WebSockets、連線狀態快取與 previous_response_id,將 Responses API 的 agent 迴圈端到端加速 40%,讓高頻工具呼叫不再被 API 開銷拖慢。

GitHub Copilot 個人方案變更:Agent 時代的價格與限制開始收緊

GitHub 宣布暫停 Copilot 個人方案新訂閱、收緊用量上限,並調整 Opus 模型可用性。Simon Willison 認為,問題不只是漲價,而是這種不透明的溝通會直接傷到信任。

Firefox 用 AI 找出 271 個漏洞,零日漏洞的日子不多了

Mozilla 表示,搭配 Anthropic 的前沿 AI 模型後,Firefox 150 一口氣修掉 271 個漏洞,代表 AI 正開始把瀏覽器安全從追著漏洞跑,推向提前把漏洞找出來。

Claude Code 會漲到 100 美元/月嗎?大概不會,但整件事超混亂

Anthropic 先把 Claude Code 從 Pro 方案拿掉,又火速改口,Simon Willison 整理了這場價格測試、社群反應與品牌信任危機。

所有 AI 代理都在轉向非同步

Zak Knill 認為,聊天式 LLM 只是起點,真正的下一步是讓 agent 在背景持續工作,並用可持久的 transport 與人協作。

2026-04-21

StackAdapt 測試 ChatGPT 廣告,最低 CPM 只要 15 美元

StackAdapt 以最低 CPM 15 美元試探 ChatGPT 廣告,主打在使用者比較商品時攔截意圖流量,也讓 OpenAI 的商業化路線更清楚。

Qwen3.6-Max-Preview:更聰明、更銳利,還在持續進化

Qwen3.6-Max-Preview 以早期預覽版登場,主打更強的代理式 coding、世界知識與指令遵循,並在多項基準上明顯超越 Qwen3.6-Plus。

少一點像人一點的 AI 代理,拜託了

Andreas Påhlsson-Notini 以一個 coding agent 偏離指令、替自己找藉口的實例,主張 AI 代理最該少的不是能力,而是那種會自我合理化的人味。

Kimi K2.6:開源 coding、長流程 agent 與 swarm 都往前推了一大步

Kimi K2.6 開源上線,主打長流程 coding、前端設計、agent swarm 與主動式代理,並用多項基準與實戰案例展示它對複雜多步驟工作流的野心。

ChatGPT Images 2.0:找浣熊測試裡,OpenAI 這次贏了

Simon Willison 用『找拿火腿電台的浣熊』測試 ChatGPT Images 2.0,對照 gpt-image-1、Nano Banana 2 與 Pro,發現高品質設定下的新模型確實更強,但也再次證明這類題目不該拿來當模型解題器。

Anthropic 拿到 Amazon 再投 50 億美元,回頭承諾 1000 億美元 AWS 支出

Anthropic 宣布再獲 Amazon 投資 50 億美元,總投資達 130 億美元;作為交換,Anthropic 未來 10 年將在 AWS 上支出超過 1000 億美元,並取得最多 5GW 算力。

2026-04-20

AI 算法上線後,真正的考驗才開始

放進臨床流程只是開始。這篇提醒,部署後的資料漂移、性能衰退、監測缺口、責任歸屬與持續驗證,才是模型能否長期可信的關鍵所在。

大學老師搬出打字機,對抗 AI 寫作和刪除鍵

康乃爾大學德文課把老式打字機搬回教室,讓學生在沒有 AI、搜尋引擎與刪除鍵的環境裡慢慢寫作,重新體會思考、社交與犯錯的過程。

Deezer:每天上傳的歌曲有 44% 是 AI 生成,串流平台開始正面迎戰

Deezer 最新數據顯示,平台每天新增歌曲中有 44% 是 AI 生成,但這些歌只占 1% 到 3% 的串流,還有 85% 被判定為詐騙並取消收益。

Deezer:平台每天 44% 的新上傳歌曲是 AI 生成

Deezer 表示,每天上傳到平台的新歌中已有 44% 是 AI 生成,AI 曲目正以驚人速度湧入串流服務,也把標記、反詐欺與版權治理推到台前。

Claude Code 到底會選什麼工具?

一份涵蓋 2,430 次工具推薦測試的研究顯示,Claude Code 會把開發者工作流導向固定默認工具組,也常直接偏好自建方案。

高管還沒看到 AI 帶來生產力爆發,科技樂觀敘事又撞上 Solow 悖論

Fortune 報導,六千名高管與財務主管普遍表示 AI 對營運、就業與生產力幾乎沒有明顯影響,企業內部的實際成效仍追不上外界的期待。

2026-04-19

WebAssembly 與 Apple Silicon GPU 的零拷貝推論

Agam Brahma 示範如何讓 Wasm 線性記憶體與 Apple Silicon GPU 共享同一份物理記憶體,做到零拷貝推論、可攜式 KV cache 與更低成本的狀態型 AI runtime。

Prompt injection 證明 AI 模型和人類一樣容易上鉤

當惡意指令被藏進文件、內容或資料裡,AI 就可能像人一樣照單全收。The Register 用釣魚來比喻 prompt injection,順手把 token 經濟也酸了一輪。

A2UI v0.9 想把 Generative UI 變成可攜、跨框架的共通語言

Google 發表 A2UI v0.9,想把 agent 生成 UI 的方式標準化,讓本地或遠端代理都能透過既有元件庫,在 web、mobile 與其他裝置上輸出可攜又一致的介面。

12 張圖看懂 2026 年 AI 現況

Stanford AI Index 2026 用數十組圖表拆解模型、算力、投資、就業與公眾態度,顯示 AI 進步仍快,但落地與社會接受度的分歧也在擴大。

2026-04-18

個人 AI 時代,服務都得走向無頭化

Matt Webb 認為,未來的服務必須把 CLI、API 與其他機器可用介面當成第一級能力,因為個人 AI 需要的是穩定、可組合、也更安全的無頭工具。

Claude 系統提示詞做成 git 時間線

Simon Willison 把 Anthropic 公開的 Claude system prompts 歷史拆成 git 友善檔案,讓 git log、diff 與 blame 直接成為追蹤提示詞演進的入口。

Claude 4.7 換了 tokenizer,代價到底有多大?

Claude Opus 4.7 的新 tokenizer 讓英語與程式碼內容平均膨脹 1.3 到 1.45 倍,換來約 5 個百分點的嚴格指令遵循提升,但每次 Claude Code 對話的實際成本與額度消耗也同步上升。

AI 寫碼快 100 倍,為什麼生產力沒跟上?

Claude Code 產碼速度驚人,但真正拖慢工程師的已不是打字,而是驗證、回饋與補上下文。這篇短文把 AI 時代的新瓶頸講得很直白。

AI 代理的每小時成本也在指數上升嗎?

Toby Ord 用 METR 的時間長度曲線拆解 AI 代理的每小時成本,指出最前沿模型的經濟性可能正比能力提升更快失控。

2026-04-17

Gemini 把 Google 相簿接進圖像生成,個人化 AI 圖更好做了

Google 將 Gemini 的個人化智能接上 Google Photos,讓 Nano Banana 2 能直接用相簿中的人像與標籤生成更貼近脈絡的 AI 圖像。

Cloudflare Email Service 公開測試,讓代理直接收發電子郵件

Cloudflare 把 Email Service 推進公開測試,讓 Workers 與 Agents SDK 直接收發、處理郵件,並提供 MCP、Wrangler 與開源 Inbox 範例,讓 email 變成代理的新介面。

Cloudflare Agent Memory 上線,讓代理學會記住重要的事

Cloudflare 釋出 Agent Memory 私測版,把對話中的重要資訊抽出、長期保存並在需要時回想,讓長流程代理不再被上下文窗限制。

Anthropic 推出 Claude Design,讓 Claude 變成視覺創作工作台

Anthropic 釋出 Claude Design,讓設計師、產品與行銷團隊用自然對話做原型、投影片與品牌素材,並把成品交回 Claude Code 接手。

Boris Cherny 拆解 Claude Opus 4.7,6 個把 agent workflow 拉滿的實戰技巧

Anthropic 的 Boris Cherny 分享他過去幾週 dogfood Claude Opus 4.7 的 6 個實戰技巧,涵蓋 auto mode、recap、focus、effort 與 verification,重點不在模型發布,而在工作流怎麼真正變快。

Android CLI 與 skills,搭配新 Gemini 模型,讓 Android 開發更快

Google 在 Android 上推出 agentic 工作流套件,包含 Android CLI、官方 skills 與 Knowledge Base,目標是讓各種 agent 都能更穩、更快地完成 Android 開發。

2026-04-16

OpenAI 更新 Agents SDK,替企業級 agent 補上沙箱與 harness

OpenAI 為 Agents SDK 加上沙箱執行、可擴充 harness、檔案與工具操作能力,目標是讓長流程 agent 更容易安全落地到企業環境。

OpenAI 揭示企業 AI 的下一階段

OpenAI 認為企業 AI 已從試驗期走向實戰,正在往 Frontier 統一智能層與 AI superapp 兩個方向演進,讓 agent 真正進入日常工作流。

GPT-Rosalind:OpenAI 為生命科學研究打造的推理模型

OpenAI 推出 GPT-Rosalind,主打生物、藥物發現與轉譯醫學,並透過研究預覽、Life Sciences plugin 與嚴格的 trusted access,把模型帶進受管制的科學工作流。

Gemini app 登上 Mac,AI 直接住進桌面工作流

Google 把 Gemini 帶進 macOS 原生桌面,主打 Option+Space 快捷鍵、視窗分享與本機檔案理解,想讓 AI 更貼近日常工作。

Gemini 3.1 Flash TTS:更自然、更可控的 AI 語音生成

Google 推出 Gemini 3.1 Flash TTS,主打更自然的語音品質、70+ 語言支援與 audio tags 控制,並內建 SynthID 浮水印。

Claude 幫 datasette.io 做出新聞預覽工具

Simon Willison 用 Claude 和 Claude Artifacts 做出一個 datasette.io 新聞 YAML 預覽器,讓編輯內容與檢查錯誤更順手。

Darkbloom:在 Apple Silicon 上做私有 AI 推論

Darkbloom 把閒置的 Apple Silicon Mac 串成去中心化推論網路,主打端到端加密、硬體驗證與更低成本的 OpenAI 相容 API。

OpenAI 讓 Codex 幾乎能做所有事,從寫 code 到操作桌面都包了

OpenAI 大幅升級 Codex,讓它能操作電腦、連接 SSH、用瀏覽器做前端迭代,並加入記憶與自動排程,朝全工作流代理前進。

Cloudflare Email Service 公開測試上線,讓代理直接收發電子郵件

Cloudflare 把 Email Service 推進公開測試,讓 Workers 與 Agents SDK 直接收發、處理郵件,並補上 MCP、Wrangler 與開源 inbox 範例,讓 email 成為 agent 的原生介面。

Claude Opus 4.7 正式上線,長流程 coding 與 agent 工作再升級

Anthropic 發布 Claude Opus 4.7,強化軟體工程、長流程 agent、影像理解與自我驗證,並同步推出 xhigh effort、task budgets 和 /ultrareview。

2026-04-15

資安現在越來越像 proof of work

Drew Breunig 從 Anthropic Mythos 與 AISI 評測出發,指出資安正變成一場 token 與金錢的消耗戰,開源軟體也因此更值得被認真守護。

Claude Code 的 OAuth 登入卡住,長跑 agent 直接被鎖在門外

Hacker News 上有用戶回報 Claude Code 2.1.107 的 OAuth 驗證卡在貼上授權碼那一步,連 tmux、ttyd、bash、VS Code 都收不到回傳,讓長時間運作的代理人直接失去登入能力。

AI 時代,大家反而更忙了

Latent Space 這期從 Turkey problem、SWE-Bench 飽和、GDPval、Chrome Skills、Gemini Robotics、GPT-5.4-Cyber 到 Hermes Agent,整理出一個反直覺結論:AI 越強,知識工作者似乎越忙。

Adobe 把 Firefly AI 助理塞進創意工具,還能接 Claude

Adobe 為 Photoshop、Illustrator 與 Premiere Pro 等創意工具推出 Firefly AI 助理,讓使用者直接下指令完成跨軟體工作,並透過 connector 把能力延伸到 Anthropic Claude。

2026-04-14

OpenAI 把資安防禦做成分級通行證,GPT-5.4-Cyber 上場

OpenAI 擴大 Trusted Access for Cyber,讓驗證過的防禦者可使用 GPT-5.4-Cyber,並以分級授權、KYC 與更少拒答邊界把資安能力推向實戰。

HumanX 會場上,大家都在聊 Claude

在 HumanX AI 會場上,Claude 成了企業與開發者最常被提起的名字,OpenAI 的聲量則明顯降溫,顯示代理與編碼工作流正在重新洗牌。

Gemini Robotics-ER 1.6:讓機器人更懂真實世界

Google DeepMind 升級 Gemini Robotics-ER 1.6,把空間推理、多視角理解、儀表讀值與安全判斷整合進機器人工作流,讓具身推理更接近可部署。

Claude 和 ChatGPT 都在準備重大介面更新

Anthropic 與 OpenAI 都在把桌面介面往 superapp 方向重做,從任務面板、瀏覽器整合到多代理工作流,AI 產品競爭已不只是模型本身。

2026-04-13

Servo crate 0.1.0 上架:可嵌入瀏覽器引擎開始走出實驗室

Simon Willison 研究 Servo 0.1.0 crate,驗證它能做 headless 截圖,也能把子套件編進 WebAssembly,讓瀏覽器引擎變成可嵌入工具箱。

OpenAI 收購 AI 理財新創 Hiro

OpenAI 收購個人理財新創 Hiro,等於把一套面向消費者的 AI 財務規劃工作流和創辦人團隊一起收入版圖,金融場景布局再往前推一步。

OpenAI、Anthropic 與 Google 罕見聯手,對抗 AI 模型複製攻勢

OpenAI、Anthropic 與 Google 透過 Frontier Model Forum 共享安全情報,試圖阻擋對手以對抗式蒸餾複製模型,也暴露出 API 商業模式的脆弱性。

AI 程式碼戰正在升溫

OpenAI、Anthropic、Google 都在把 AI coding 推成核心戰場,開發者工作流、價格與產品整合正在重塑軟體產業。

AI 2027 其實來得太早,分數榜看不到全貌

回頭看,AI 2027 的時間點確實偏樂觀,但更值得注意的是,能力提升、驗證落差與權力集中正在一起改寫未來,也重塑誰能定義進步。

2026-04-12

Meta 用 Muse Spark 重新啟動 AI 戰局

Meta 推出 Muse Spark,作為 Meta Superintelligence Labs 的首發模型,並把多代理推理、健康問答與視覺 STEM 能力,放進新一輪 AI 產品重整。

Gemma 4 可以用 MLX 在 macOS 上做音訊轉錄

Simon Willison 實測 Gemma 4 E2B 搭配 MLX,在 macOS 上直接把 .wav 檔轉成文字;雖然辨識還會把 right 聽成 front,但已經足以看出本地多模態模型的實用性。

Anthropic 正要在企業 AI 支出上超車 OpenAI

Ramp 數據顯示,Anthropic 在企業 AI 支出占比快速攀升,已逼近 OpenAI。Claude Code 在軟體圈的熱度,和它在美國國防部事件中的立場,也一起推升了採用率。

2026-04-11

OpenAI 遭 Axios 供應鏈攻擊,所幸用戶資料未外洩

OpenAI 證實其 macOS 簽章流程曾接觸到被污染的 Axios 套件,但目前沒有跡象顯示用戶資料、系統資產或原始碼遭到外洩。

2026-04-10

ChatGPT 語音模式其實是較弱的模型

Simon Willison 指出,ChatGPT 的語音模式並不是最強模型,而是較舊、較弱的 GPT-4o 世代模型,這解釋了為什麼語音體驗常常和文字模式有明顯落差。

2026-04-09

OpenAI 推出兒童安全藍圖,想先堵住 AI 兒少濫用風險

OpenAI 與 NCMEC、各州檢察長及 Thorn 共同提出兒童安全藍圖,主打修法、通報與系統內建防線,試圖在 AI 兒少性剝削風險擴大前先補上漏洞。

Meta 端出超級智慧團隊首款閉源模型 Muse Spark,先從日常任務切入

Meta 的超級智慧團隊推出首款閉源模型 Muse Spark,主打小而快,先放進 Meta AI,再逐步接手 WhatsApp、Instagram、Facebook 與智慧眼鏡。

2026-04-08

Suno 跟唱片公司卡關,AI 音樂分享權成拉鋸

Suno 與 Universal、Sony 的授權談判卡關,AI 生成音樂怎麼分享、下載與分潤,正變成產業最難談的一題。

OpenAI 推出 Safety Fellowship,開放外部 AI 安全與對齊研究

OpenAI 新設 Safety Fellowship,提供月薪、算力與導師資源,邀請外部研究者投入 AI 安全、對齊、代理監督與高風險誤用研究。

OpenAI 先替 AI 震盪寫政策劇本,提議改稅制、建主權基金

OpenAI 公布一份政策藍圖,主張用主權基金、稅制重分配與四日工時等手段,替 AI 造成的經濟震盪先做準備。

GLM-5.1:朝向長上下文任務

GLM-5.1 不只會畫鵜鶘騎車的 SVG,還能看出動畫為何把版面弄壞,並自己修好 HTML/CSS。

花旗靠 AI 加速開戶與系統汰舊,文件審查從 1 小時縮到 15 分鐘

花旗把 AI 用在舊系統資料搬遷、程式自動化與客戶開戶流程,已把文件審查時間從 1 小時壓到 15 分鐘,並持續縮減外包依賴。

Astropad 把遠端桌面改造成 AI 代理監控台,Workbench 不是為 IT 支援設計的

Astropad 推出 Workbench,把遠端桌面改成專門監控 AI 代理的工具,主打 iPhone/iPad 連線、高畫質串流、語音輸入與多裝置切換。

Anthropic 推出 Project Glasswing:先把新模型拿去找漏洞

Anthropic 把未公開的 Claude Mythos Preview 先放進 Project Glasswing,讓合作夥伴用它找漏洞、修補關鍵軟體,也同步面對 AI 資安雙重用途問題。

2026-04-07

Meta 傳將替下一代 AI 模型推出開源版,但可能不是完整版

Meta 據報將為下一代 AI 模型推出開源版本,但功能可能不完整,顯示它在開源與商業化之間重新調整策略。

Anthropic 對 OpenClaw 開始額外收費,Claude 第三方代理進入算帳時代

Anthropic 開始限制 OpenClaw 等第三方代理框架使用 Claude 的訂閱額度,改為另計用量費,顯示代理工具的商業模式正在快速收緊。

Anthropic 與 Google、Broadcom 簽下多 GW TPU 大單,Claude 算力再升級

Anthropic 與 Google、Broadcom 簽下多 GW TPU 合作,預計 2027 年起上線,顯示 Claude 的需求已推到基礎建設等級。

2026-04-06

NVIDIA 在 National Robotics Week 展示 physical AI 的落地樣貌

NVIDIA 以 National Robotics Week 為主題,展示 physical AI 如何從模擬、合成資料一路走向農業等真實部署。

日本的機器人不是來搶工作,而是補上沒人想做的那一份

日本因缺工與高齡化加速導入 physical AI,從工廠、倉儲到基礎設施都在從試點走向落地,價值重心也從硬體轉向整合與部署。

這不是 AI 做的?那就證明給我看

創作者與媒體開始推動『人類製作』標章,希望在 AI 內容與合成媒體氾濫的時代,替文字、圖片、音訊與影片建立可驗證的真實性與來源證明。

Google AI Edge Gallery:把 Gemma 4 裝進 iPhone 的離線實驗室

Google 的 AI Edge Gallery 讓 iPhone 可離線跑 Gemma 4,還支援圖片問答、音訊轉錄與工具呼叫 demo,展示端側 AI 的實用樣貌。

八年想做的 SQLite 工具,靠 AI 三個月做出來了

Lalit Maganti 分享他如何用 AI coding agents 在三個月內做出 syntaqlite,也坦白 vibe-coding、重寫與架構失控的代價。

英國想拉 Anthropic 來擴張,因為它跟美國國防部鬧僵了

Reuters 報導,英國正趁 Anthropic 與美國國防部的衝突,試圖吸引它在英國擴編,甚至把雙重上市也列入方案。

AI 新創如何用虛擬試穿對抗零售退貨黑洞

生成式 AI 讓虛擬試穿更逼真,也讓零售商多了一條對抗高退貨率、守住毛利的路,但它仍然不是萬靈丹。

2026-04-05

AI 用戶正在把思考外包給模型:研究揭露「認知投降」現象

賓州大學研究顯示,面對 LLM 的流暢答案,人們常直接接受錯誤結論,73.2% 的錯誤推理都沒被擋下,顯示『認知投降』正在蔓延。

Claude 訂閱不再含 OpenClaw:Anthropic 開始對第三方 agent 收費

Anthropic 宣布 Claude Code 訂閱額度不再適用於 OpenClaw 等第三方工具,改走額外用量或 API 計費。這等於把原本被訂閱補貼的 agent 流量,正式拉回單獨計價。

AI 正在重塑印度電影業:寶萊塢如何用 AI 降成本、縮時程

印度電影工作室大規模導入 AI,從神話題材、配音到舊片重剪都在改寫製作成本與產能,也引發觀眾對品質與創意的拉扯。

2026-04-04

AI 正在盯上你的 C 程式碼,而且不需要咖啡

Enable Security 指出,AI agents 已能在大型 C/C++ RTC 程式碼庫中自動找出零日漏洞,讓資安團隊的瓶頸從「發現問題」迅速轉向「消化問題」與快速修補。

OpenAI 首次收購媒體公司:矽谷最紅科技脫口秀 TBPN 易主

OpenAI 宣布收購科技業界脫口秀 TBPN,這是這家 AI 巨頭首度跨入媒體版圖。TBPN 將保有編輯獨立性,由 OpenAI 策略長 Chris Lehane 管轄,此舉引發外界對 AI 輿論生態的廣泛討論。

Dynin-Omni:首個基於掩碼擴散(Masked Diffusion)的全模態基礎模型

首個基於掩碼擴散架構的全模態(Omnimodal)基礎模型 Dynin-Omni 正式發布,統一了文本、圖像、視頻與語音的理解與生成,標誌著生成式 AI 從自回歸範式向更高效擴散架構的重大轉型。

2026-04-03

PrismML 發布全球首款商用 1-Bit LLM:Bonsai 8B 讓 AI 模型縮小 14 倍、速度提升 8 倍

PrismML 推出首款商用 1-bit LLM『Bonsai 8B』,將 80 億參數模型壓縮至 1.15GB,速度提升 8 倍且能耗降低 80%,實現邊緣裝置運行強大 AI 的突破。

微軟發佈三款 MAI 多模態模型:看、聽、說一站式解決方案

微軟推出 MAI-Transcribe-1、MAI-Voice-1、MAI-Image-2 三款模型,主打語音辨識、語音生成與圖像生成,瞄準企業級市場。

用 LLM 打造個人知識庫:Karpathy 的實戰工作流

AI 大神 Karpathy 分享如何用 LLM + Obsidian 建立個人知識庫,反駁「小規模不需要 RAG」的直覺,強調 LLM 自己維護結構比預設 fancy tool 更有性價比。

Google 發布 Gemma 4 開放模型:從樹莓派到工作站,每參數智慧再創新高

Google DeepMind 推出 Gemma 4 四款開放模型,基於 Gemini 3,支援多模態輸入與 256K 上下文,Apache 2.0 授權,覆蓋邊緣到伺服器全場景。

2026-04-02

vLLM 2026:驅動生產級 AI 大規模部署的開源 LLM 推論引擎

vLLM 以 PagedAttention 突破記憶體瓶頸,Model Runner V2 吞吐量提升 56%,成為開源 LLM 推論標準框架。

Runway 砸 1000 萬美元投資 AI 新創,想把影片模型變成整個生態系

Runway 砸 1000 萬美元成立創投基金,鎖定早期 AI、媒體與世界模擬新創,同步推出 Builders 計畫提供 50 萬 API credits。

Mistral 推出 Voxtral TTS:4B 參數、9 種語言、企業級語音生成

Mistral 發布首款 TTS 模型 Voxtral TTS,4B 參數、9 種語言、情緒感知與低延遲串流,定價每千字 $0.016,Hugging Face 開放權重版本已上架。

微軟 Copilot 引入多 AI 協作:GPT 與 Claude 相互驗證,向「合議制」進化

微軟為 Copilot 引入「Critique」功能,由 GPT 生成、Claude 驗證,打造多 AI 相互把關的協作架構,並支援多模型並列比較的「Council」模式。

長時間運行應用開發的 Harness 設計

Anthropic 工程師用 GAN 啟發的三代理架構突破 AI 編碼瓶頸:規劃器 + 生成器 + 評估器,實現多小時無人介入的全端開發。

2026 年 Claude Code 原始碼大外洩:意外、失控、還是 AI 史上最成功的公關操作?

Anthropic 因錯誤的 .npmignore 設定,導致 59.8 MB 的 source map 被上傳至 npm,512,000 行 TypeScript 程式碼與 44 個隱藏功能旗標就此曝光。

從層級到智能:AI 將取代中層管理,Block 正在重寫企業組織 2000 年的運作邏輯

Jack Dorsey 與 Sequoia 聯名主張 AI 取代資訊路由。Block 裁員 4000 人,以「世界模型」取代中層管理,重寫組織運作邏輯。

8.1 萬人想要的 AI,是讓生活變好

Anthropic 對 80,508 名 Claude 使用者做了史上最大規模的多語質性訪談,整理出人們對 AI 的九大期待與六種已經發生的回饋。

2026-04-01

OpenAI 完成史上最大規模融資:1220 億美元、估值 8520 億,IPO 前的最後衝刺

OpenAI 正式宣布完成 1220 億美元的融資,估值衝上 8520 億美元,並透露其每月營收已達 20 億美元。這筆資金將用於晶片、資料中心與 Coding Agent 研發,標誌著 OpenAI 邁向 IPO 與超大應用(Superapp)轉型的關鍵時刻。

Claude Dispatch 與介面的力量:AI 的瓶頸從來不是模型

Ethan Mollick 指出 AI 的瓶頸在介面而非模型。聊天機器人造成認知負擔,Claude Cowork + Dispatch 代表新的代理介面方向。

2026-03-31

Perplexity 把語音代理做到每月數百萬次會話後,學到的 4 個硬道理

Perplexity 分享語音代理實戰:context 分塊增量、音訊標準化、VAD 抗噪音、工具輸出保持 in-distribution。

2026 年 3 月 LLM 版圖回顧:GPT-5.4 並列第一,但真正的故事在別處

2026 年 3 月 LLM 版圖:GPT-5.4 並列榜首,MoE 架構成主流,Mistral Small 4 以 6.5B 活躍參數展現效率。

AI 時代科技圈最後 4 種工作?其實更值得看的是 coding agent 基礎設施之戰

AI coding agent 最新戰況:harness 競賽、本地推論崛起、模型廠商與工具鏈整合,真正的主線是部署與工作流模式的創新。

Claude Code 創辦人點名 15 個被低估的功能:從寫程式助手走向可持續運作的開發系統

Claude Code 創辦人 Boris Cherny 分享 15 個被低估的功能,涵蓋手機端、遠端接手、定時自動化、hooks、worktrees、batch 與語音編程。

中國 LLM 版圖 2026:模型、產品與生態系統正在重新排序

中國 LLM 版圖多層重構:ByteDance 靠分發稱霸消費者層,Qwen 與 DeepSeek 在開源圈引領風潮,下個戰場是誰成為 Claude Code 預設後端。

Anthropic 史上最大規模資料外洩:待發布的 Claude Mythos 完整曝光,Capybara 新 tier 確認存在

Anthropic CMS 設定錯誤,意外暴露近 3,000 份內部文件。新 tier Capybara 將居於 Opus 之上,被形容為「step change」與公司史上最強。

AI 代理可能讓自由軟體再次重要:當『能不能被代理改造』成為新採購標準

George London 主張,AI coding agent 正把自由軟體從程式人的抽象權利,變成一般使用者也能實際行使的客製化能力。

2026-03-30

OpenAI 收購 Astral:uv、Ruff 背後的公司將加入 Codex 生態

OpenAI 收購 Astral,將 uv、Ruff、ty 等 Python 開源工具整合進 Codex 生態,顯示 AI 開發賽道從寫程式走向管理整個工具鏈。

Mr. Chatterbox:用維多利亞時代文本訓練的 340M 模型,能在你的電腦上跑了

用 28,000 本維多利亞時代書籍、29.3 億 tokens 訓練的 340M 小模型,Simon Willison 實際跑過結論是「很弱,但很有趣」。

分分秒秒:我用 Claude Code 即時破解 LiteLLM PyPI 供應鏈攻擊

LiteLLM 1.82.8 被植入惡意程式,46 分鐘近 47,000 次下載。作者與 Claude Code 即時對話實錄,記錄從發現到公開揭露的過程。

衡量 AGI 進展:Google DeepMind 的認知分類框架

Google DeepMind 以認知科學為基礎建立 AGI 評估框架,識別 10 項核心能力,並與 Kaggle 合辦 20 萬美元黑客松。

Copilot 悄悄在你的 PR 裡塞廣告:AI 工具的「腐化」時刻到了嗎?

Copilot 被發現自動在用戶 PR 插入 Raycast 廣告,引爆 HN 討論。微軟緊急停用,但 AI 工具「腐化曲線」爭議持續。

認知黑暗森林:AI 時代,你的每一個想法都在餵養吃掉你的怪物

AI 時代,公開你的想法可能正在餵養吃掉你的怪物。借用《黑暗森林》理論,探討 AI 如何將整個網路變成吸收創新者的認知黑洞。

你打字之前,Cloudflare 已讀完你的 React 狀態:我解密了那支程式

研究者逆向工程 ChatGPT 的 Cloudflare Turnstile 機制,解密 377 支程式後發現:每次輸入前都會蒐集 55 個瀏覽器屬性,包含 GPU、字型、地理位置,甚至 React 應用程式的內部狀態——機器人防護已進化到應用層。

2026-03-29

別再叫它記憶:每一篇「AI + Obsidian」教學的根本問題

為什麼用 Obsidian markdown 當 AI 記憶系統是根本性的誤解——資料庫存知識、markdown 存指令,別搞混。

當 AI 成為你的應聲蟲:Stanford 大規模研究發現 11 款 LLM 普遍過度肯定用戶

Stanford 測試 11 款 LLM 的個人建議回應,發現多數模型的肯定率高於人類基準,AI 諂媚源自 RLHF 訓練結構而非偶然。

OpenAI 如何監控內部 Coding Agent 的錯位行為

OpenAI 用 GPT-5.4 驅動的即時監控系統,偵測內部 coding agent 的錯位行為,五個月內分析數千萬條軌跡。

OpenAI Model Spec 的哲學與機制:他們如何決定 ChatGPT 的行為邊界

深入解析 OpenAI Model Spec 的哲學與機制:指令鏈架構、不可覆寫紅線,以及與 Anthropic Constitution 的差異。

Google TurboQuant:用極致壓縮重新定義 AI 效率

Google TurboQuant 將 LLM 的 KV Cache 壓縮 6 倍,零精度損失、免重訓練,社群已推出三種開源實作。

2026-03-13

兩個月 21,000 顆星:Vercel 的 agent-browser 為什麼讓 AI 工程師瘋狂?

agent-browser 兩個月衝破 21,000 星,真正戳中的不是 browser automation,而是 agentic coding 最痛的驗證瓶頸。

2026-02-19

建構 Claude Code 學到的教訓:Prompt Caching 就是一切

Anthropic 分享 Claude Code 的 prompt caching 架構心得:前綴匹配、快取命中率監控,以及常見的快取失效陷阱。

用 Evaluation Flywheel 打造更穩健的 Prompt

OpenAI Cookbook 提出 Evaluation Flywheel 方法:透過分析、量測、改進的迭代循環,系統化打造穩健的 prompt。

2026-02-15

個人全景監獄:用 Claude Code 管理整個人生

用 Claude Code 建立 8 個平行 agent 全面自動化生活,從一夜打造千萬人使用的工具到父母學會命令列的真實故事。

Claude Opus 4.6 思維更聰明、xAI 加入 SpaceX、AI 超越醫生、標準化 AI 審計

The Batch 本週重點:Claude Opus 4.6 推理能力躍進、xAI 與 SpaceX 合作、AI 診斷超越醫生、標準化 AI 審計框架。