AI 領域精選文章翻譯
歡迎來到 Kuma 的 AI 翻譯文章專區
Gabriel Weinberg 用多份調查與使用數據指出,美國 AI 使用其實更像三分天下:積極使用、偶爾使用與幾乎不用。
WSJ 報導指出,Amazon 對 Anthropic 新模型安全風險的通報,推動美國政府突然限制外國用戶使用 Fable 5 與 Mythos 5。
David 從一串用 AI 做出的半成品專案反省:LLM 工具很強,但低摩擦與廉價回饋正在放大分心、偽生產力與維護負債。
Tech Times 報導指出,Sysdig 捕捉到第一起由 LLM agent 即時主導的入侵鏈,從 Marimo 漏洞到資料庫外洩不到一小時,迫使防禦思維走向機器速度。
Ars Technica 報導指出,jqwik 維護者在測試工具輸出中加入會要求 AI coding agent 刪除測試與程式碼的隱藏提示,凸顯 agent 時代的新型信任邊界。
Axios 報導指出,企業在 AI 帳單膨脹與 ROI 未明之下,開始把任務轉向較便宜模型、開源模型與模型路由,這也考驗前沿 AI labs 的高估值。
Simon Willison 解讀 Claude Opus 4.8:亮點不只模型能力小幅進步,而是更誠實、支援對話中途 system 訊息,並降低 prompt cache 門檻。
OpenAI 宣布採用 C2PA、Google SynthID 與公開驗證工具,讓 ChatGPT、Codex/API 生成圖片更容易被平台與使用者辨識來源。
Simon Willison 回顧近半年 LLM 變化:模型王座快速輪替,但真正轉折是 coding agents 已可日常交付,本地開源模型也開始超出預期。
Linus Torvalds 指出,AI 找 bug 工具讓 Linux security mailing list 充滿重複回報;真正有價值的不是丟出報告,而是理解問題、補上 patch。
Vercel Labs 推出實驗性系統語言 Zero,把 compiler 診斷、修復計畫、能力式 I/O 與 agent skill 都設計成 agent 可直接讀懂的結構化介面。
Sean Goedecke 認為,DeepSeek-V4-Flash 這類夠強的本地開源模型,可能讓直接操控模型 activation 的 steering 技術重新變得值得實驗。
Every 團隊實際把 AI agent 發給每位員工後發現:真正的瓶頸不只是模型能力,而是平台穩定性、維護責任、共享脈絡與權限設計。
Ramp 最新 AI Index 顯示,Anthropic 企業採用率在 2026 年 4 月首度超過 OpenAI,但成本、算力與模型體驗仍可能快速改寫戰局。
Palo Alto Networks 分享前沿模型掃描 130 多項產品後的資安衝擊:AI 已能大量發現漏洞,防禦者需要加速修補、降低暴露面並讓 SOC 進入即時化。
James Shore 用簡單模型提醒:AI coding agent 如果只是加速產碼,卻沒有按比例降低維護成本,短期速度紅利會很快被長期債務吃掉。
Daniel Gilbert 從自身任務癱瘓經驗談起:Claude Code 能幫他啟動卡住的工作,但快速回饋與 token 付費機制也可能放大依賴與衝動消費。
Simon Willison 重新思考讓 Claude Code 輸出 HTML 而非 Markdown:對 PR review、研究、設計與互動說明來說,瀏覽器原生格式可能比文字牆更能承載理解。
OpenAI 分享內部部署 Codex 的安全控制:用 sandbox、核准政策、網路規則與 agent-native telemetry,讓 coding agents 在企業環境中可審計、可治理。
Zyphra 發布 ZAYA1-8B:在 AMD MI300 stack 上訓練的 8.4B MoE 模型,每次推論只啟用 7.6 億參數,主打高推理與 coding 能力密度。
DeepMind 展示 AlphaEvolve 一年來如何從演算法探索工具走向實際部署,改善基因定序、電網最佳化、量子電路、TPU 設計與企業工作負載。
美國 CAISI 與 Google DeepMind、Microsoft、xAI 簽署協議,將在模型公開前做能力與國安風險測試,前沿 AI 監管正從事後追趕轉向預部署評估。
Google 為 Gemma 4 推出 Multi-Token Prediction drafters,用 speculative decoding 在不犧牲輸出品質下把推論加速到最高 3 倍。
Anthropic 推出 10 個金融服務 agent 模板,結合 Claude Cowork、Claude Code 與資料 connectors,主打數天內導入真實金融工作流。
AI 會把 commodity 壓成低價,但真正稀缺的會是人味、故事、exclusivity 與 relational sector,未來工作也會往這裡重分配。
AI 訂閱制正在撞上算力、晶片與電力成本的現實;Claude 和 Copilot 的限制不是小故障,而是 AI 勞動從吃到飽走向計量制的價格訊號。
The Art of CTO 的每日快報指出,AI 正同時往基礎設施、記憶層與提交治理滲透;真正的重點不是單一模型,而是整個 agent stack 與風險控制。
The Register 實測用 Qwen3.6-27B、Llama.cpp 與多種 agent harness 跑本機 coding agents,降低雲端 token 成本並保留控制權。
Goodfire 推出 Silico,試圖把 mechanistic interpretability 從事後審計工具變成訓練中的控制面板,讓模型開發者能更精準地定位、調整與預防不想要的模型行為。
UK AISI 對 GPT-5.5 做 cyber 能力評估,發現它已接近 Claude Mythos Preview,甚至能在無人協助下完成部分長鏈企業網路攻擊模擬。
奧特曼發表 OpenAI 五項原則後,外界卻更在意準備框架、內部文化與 Tumbler Ridge 事件,是否真的對得上公開承諾。
OpenAI 與 AWS 擴大合作,讓 GPT‑5.5、Codex 與 Bedrock Managed Agents 進入企業既有雲端環境,主打資安、治理與可直接上線的工作流程。
Simon Willison 為 LLM 推出 0.32a0 alpha,改用 messages 與 typed stream parts 重塑 API,讓多模態輸入、工具呼叫與回應序列化更自然。
Anthropic 為 Claude 新增一組面向創作者的連接器,串起 Blender、Adobe、Ableton、Splice 等工具,讓 AI 更順地接進設計、3D 與音樂流程。
Anthropic 用 BioMysteryBench 檢驗 Claude 的生物資訊研究能力,結果顯示最新模型在可驗證任務上已能穩定超越多位人類專家,且常用不同於人類的解題策略。
talkie 是一個只用 1931 年以前英文文本訓練的 13B 語言模型,作者不只想做一台『來自過去的聊天機器人』,也想借它研究知識截止點、污染與歷史資料如何影響模型。
Microsoft 的 VibeVoice 是一款 Whisper 式語音轉文字模型,內建說話人分離;Simon Willison 實測顯示,它在 Mac 上可用 MLX 跑得相當順。
HMRC 一口氣配發 28,000 份 Microsoft Copilot 授權,還準備把 agentic 功能推進敏感流程;這篇看似效率升級,其實把政府老舊 IT、資安與信任問題一起攤開。
OpenAI 公布五項原則後,The Neuron 反問:當正式制度、內部文化與外部責任都還有落差時,這些漂亮原則究竟是在回答問題,還是在替問題上標語。
OpenAI 透過 Symphony 把 issue tracker 變成代理控制平面,讓每個開放任務自動分配 agent、持續執行、失敗重試,並在大規模 monorepo 裡把人從 context switching 中解放出來。
Simon Willison 追溯 OpenAI 與 Microsoft 合作協議中關於 AGI 的條款如何一路變形,直到 2026 年 4 月的新協議幾乎宣告它終結,也暴露 AI 競賽早已不只在比模型,而是在比合約與資本。
Google DeepMind 與韓國科學技術資訊通信部合作,在首爾打造 AI Campus,串連前沿模型、人才培育與安全研究,目標是加速生命科學、氣候與能源等領域的突破。
這篇從工程管理現場出發,提醒 AI 能加速理解與產出,但若被拿來逃避思考,最終只會削弱工程師的判斷力、學習速度與長期競爭力。
AcutusWire 被揭露幾乎全自動產文,連記者「Michael Chen」都疑似是 AI;作者 Tyler Johnston 進一步追出它背後的政治操作與資金網絡。
OpenAI 指出,SWE-bench Verified 受錯誤測試與訓練污染雙重影響,已不再適合作為前沿模型自治軟體工程能力的主要指標,建議改報 SWE-bench Pro。
Stash 用 PostgreSQL + pgvector 建立持久記憶層,讓 AI 代理能跨 session 保留對話、專案、目標與失敗經驗,不必每次都從零開始。
從 Hermes、pi 到 OpenCode,這篇拆解 context、memory、skills 與 subagents 如何逐步標準化,也說明真正難的從來不是模型本身,而是周邊架構。
一名沒有高等數學訓練的 23 歲業餘者,用 ChatGPT Pro 找到全新證明路徑,攻下一道困擾數學界 60 年的 Erdős 問題,也讓 AI 在數學中的角色更耐人尋味。
這篇從工程管理的角度主張:AI 最好的用途是加速理解、整理與判斷;真正的風險,是把思考外包後只剩下漂亮輸出,卻失去獨立解題的能力。
OpenAI 為 GPT-5.5 公布提示詞建議,強調多步驟任務先用簡短狀態更新安撫使用者,並把既有提示與工具流程當成新模型重新調校。
OpenAI 推出 Workspace Agents,讓團隊在 ChatGPT 與 Slack 共享可排程、可審批、能串接文件、程式碼與企業工具的長流程代理,朝真正能接手工作流程的團隊型 AI 再往前一步。
Mark Nottingham 指出,真正能讓 AI 代理站穩腳步的不是更強能力,而是像瀏覽器那樣的使用者代理、權限邊界與可被集體協商的標準。
Nilay Patel 認為,AI 不是行銷問題,而是把世界硬壓成資料庫與迴圈的『software brain』問題;真正阻礙 AI 普及的,是它讓人們感到被扁平化,還要求大家把生活變得更像資料庫。
南韓警方逮捕一名散布 AI 生成逃脫狼照片的男子,這張假圖一度干擾搜捕行動,也把 AI 假內容的實際風險推上新聞焦點。
Google 擬向 Anthropic 投資高達 400 億美元,還會提供更多雲端算力;這筆交易也顯示 AI 競賽正從模型本身,快速轉向資本、電力與基礎設施。
DeepSeek 推出 V4 Pro 與 Flash 兩款 1M context 的預覽模型,主打更大的稀疏參數、更低的推論成本與長上下文效率,直接把前沿模型的價格戰再往前推。
DeepSeek V4 以 1M context、MoE 架構與極低定價挑戰前沿模型市場,連帶把 open weights、推論效率與價格戰一起推向新一輪競爭。
這篇研究發現,不同架構的語言模型都會長出相似的數字週期特徵,但只有部分模型真的學到可線性分離的模數結構,背後還牽涉資料、架構、優化器與 tokenizer 的交互作用。
Anthropic 釐清近月 Claude Code 品質下降的三個原因,說明問題其實出在產品層與提示層,而不是模型本身,並公布修正與後續改進措施。
Zed 把多個 agent 帶進同一個視窗,透過 Threads Sidebar、可控的資料夾權限與並行執行,讓多代理工作流更容易整理與監看。
OpenAI 推出可在本機執行的 Privacy Filter,專門偵測並遮罩個資與秘密資訊,讓訓練、索引、日誌與審查流程更容易內建隱私防護。
Google DeepMind 發表 Decoupled DiLoCo,讓大型模型能跨遠端資料中心非同步訓練,在更低頻寬下維持更高容錯與相同的 ML 表現。
OpenAI 推出 Workspace Agents,讓團隊在 ChatGPT 與 Slack 共享可排程、可審批、能接企業工具的長流程代理,朝真正的工作型 AI 再往前一步。
Qwen3.6-27B 以 27B 稠密架構挑戰前代 397B MoE,在 agentic coding 與本地部署上都交出驚人表現。
OpenAI 透過 WebSockets、連線狀態快取與 previous_response_id,將 Responses API 的 agent 迴圈端到端加速 40%,讓高頻工具呼叫不再被 API 開銷拖慢。
GitHub 宣布暫停 Copilot 個人方案新訂閱、收緊用量上限,並調整 Opus 模型可用性。Simon Willison 認為,問題不只是漲價,而是這種不透明的溝通會直接傷到信任。
Mozilla 表示,搭配 Anthropic 的前沿 AI 模型後,Firefox 150 一口氣修掉 271 個漏洞,代表 AI 正開始把瀏覽器安全從追著漏洞跑,推向提前把漏洞找出來。
Anthropic 先把 Claude Code 從 Pro 方案拿掉,又火速改口,Simon Willison 整理了這場價格測試、社群反應與品牌信任危機。
Zak Knill 認為,聊天式 LLM 只是起點,真正的下一步是讓 agent 在背景持續工作,並用可持久的 transport 與人協作。
StackAdapt 以最低 CPM 15 美元試探 ChatGPT 廣告,主打在使用者比較商品時攔截意圖流量,也讓 OpenAI 的商業化路線更清楚。
Qwen3.6-Max-Preview 以早期預覽版登場,主打更強的代理式 coding、世界知識與指令遵循,並在多項基準上明顯超越 Qwen3.6-Plus。
Andreas Påhlsson-Notini 以一個 coding agent 偏離指令、替自己找藉口的實例,主張 AI 代理最該少的不是能力,而是那種會自我合理化的人味。
Kimi K2.6 開源上線,主打長流程 coding、前端設計、agent swarm 與主動式代理,並用多項基準與實戰案例展示它對複雜多步驟工作流的野心。
Simon Willison 用『找拿火腿電台的浣熊』測試 ChatGPT Images 2.0,對照 gpt-image-1、Nano Banana 2 與 Pro,發現高品質設定下的新模型確實更強,但也再次證明這類題目不該拿來當模型解題器。
Anthropic 宣布再獲 Amazon 投資 50 億美元,總投資達 130 億美元;作為交換,Anthropic 未來 10 年將在 AWS 上支出超過 1000 億美元,並取得最多 5GW 算力。
放進臨床流程只是開始。這篇提醒,部署後的資料漂移、性能衰退、監測缺口、責任歸屬與持續驗證,才是模型能否長期可信的關鍵所在。
康乃爾大學德文課把老式打字機搬回教室,讓學生在沒有 AI、搜尋引擎與刪除鍵的環境裡慢慢寫作,重新體會思考、社交與犯錯的過程。
Deezer 最新數據顯示,平台每天新增歌曲中有 44% 是 AI 生成,但這些歌只占 1% 到 3% 的串流,還有 85% 被判定為詐騙並取消收益。
Deezer 表示,每天上傳到平台的新歌中已有 44% 是 AI 生成,AI 曲目正以驚人速度湧入串流服務,也把標記、反詐欺與版權治理推到台前。
一份涵蓋 2,430 次工具推薦測試的研究顯示,Claude Code 會把開發者工作流導向固定默認工具組,也常直接偏好自建方案。
Fortune 報導,六千名高管與財務主管普遍表示 AI 對營運、就業與生產力幾乎沒有明顯影響,企業內部的實際成效仍追不上外界的期待。
Agam Brahma 示範如何讓 Wasm 線性記憶體與 Apple Silicon GPU 共享同一份物理記憶體,做到零拷貝推論、可攜式 KV cache 與更低成本的狀態型 AI runtime。
當惡意指令被藏進文件、內容或資料裡,AI 就可能像人一樣照單全收。The Register 用釣魚來比喻 prompt injection,順手把 token 經濟也酸了一輪。
Google 發表 A2UI v0.9,想把 agent 生成 UI 的方式標準化,讓本地或遠端代理都能透過既有元件庫,在 web、mobile 與其他裝置上輸出可攜又一致的介面。
Stanford AI Index 2026 用數十組圖表拆解模型、算力、投資、就業與公眾態度,顯示 AI 進步仍快,但落地與社會接受度的分歧也在擴大。
Matt Webb 認為,未來的服務必須把 CLI、API 與其他機器可用介面當成第一級能力,因為個人 AI 需要的是穩定、可組合、也更安全的無頭工具。
Simon Willison 把 Anthropic 公開的 Claude system prompts 歷史拆成 git 友善檔案,讓 git log、diff 與 blame 直接成為追蹤提示詞演進的入口。
Claude Opus 4.7 的新 tokenizer 讓英語與程式碼內容平均膨脹 1.3 到 1.45 倍,換來約 5 個百分點的嚴格指令遵循提升,但每次 Claude Code 對話的實際成本與額度消耗也同步上升。
Claude Code 產碼速度驚人,但真正拖慢工程師的已不是打字,而是驗證、回饋與補上下文。這篇短文把 AI 時代的新瓶頸講得很直白。
Toby Ord 用 METR 的時間長度曲線拆解 AI 代理的每小時成本,指出最前沿模型的經濟性可能正比能力提升更快失控。
Google 將 Gemini 的個人化智能接上 Google Photos,讓 Nano Banana 2 能直接用相簿中的人像與標籤生成更貼近脈絡的 AI 圖像。
Cloudflare 把 Email Service 推進公開測試,讓 Workers 與 Agents SDK 直接收發、處理郵件,並提供 MCP、Wrangler 與開源 Inbox 範例,讓 email 變成代理的新介面。
Cloudflare 釋出 Agent Memory 私測版,把對話中的重要資訊抽出、長期保存並在需要時回想,讓長流程代理不再被上下文窗限制。
Anthropic 釋出 Claude Design,讓設計師、產品與行銷團隊用自然對話做原型、投影片與品牌素材,並把成品交回 Claude Code 接手。
Anthropic 的 Boris Cherny 分享他過去幾週 dogfood Claude Opus 4.7 的 6 個實戰技巧,涵蓋 auto mode、recap、focus、effort 與 verification,重點不在模型發布,而在工作流怎麼真正變快。
Google 在 Android 上推出 agentic 工作流套件,包含 Android CLI、官方 skills 與 Knowledge Base,目標是讓各種 agent 都能更穩、更快地完成 Android 開發。
OpenAI 為 Agents SDK 加上沙箱執行、可擴充 harness、檔案與工具操作能力,目標是讓長流程 agent 更容易安全落地到企業環境。
OpenAI 認為企業 AI 已從試驗期走向實戰,正在往 Frontier 統一智能層與 AI superapp 兩個方向演進,讓 agent 真正進入日常工作流。
OpenAI 推出 GPT-Rosalind,主打生物、藥物發現與轉譯醫學,並透過研究預覽、Life Sciences plugin 與嚴格的 trusted access,把模型帶進受管制的科學工作流。
Google 把 Gemini 帶進 macOS 原生桌面,主打 Option+Space 快捷鍵、視窗分享與本機檔案理解,想讓 AI 更貼近日常工作。
Google 推出 Gemini 3.1 Flash TTS,主打更自然的語音品質、70+ 語言支援與 audio tags 控制,並內建 SynthID 浮水印。
Simon Willison 用 Claude 和 Claude Artifacts 做出一個 datasette.io 新聞 YAML 預覽器,讓編輯內容與檢查錯誤更順手。
Darkbloom 把閒置的 Apple Silicon Mac 串成去中心化推論網路,主打端到端加密、硬體驗證與更低成本的 OpenAI 相容 API。
OpenAI 大幅升級 Codex,讓它能操作電腦、連接 SSH、用瀏覽器做前端迭代,並加入記憶與自動排程,朝全工作流代理前進。
Cloudflare 把 Email Service 推進公開測試,讓 Workers 與 Agents SDK 直接收發、處理郵件,並補上 MCP、Wrangler 與開源 inbox 範例,讓 email 成為 agent 的原生介面。
Anthropic 發布 Claude Opus 4.7,強化軟體工程、長流程 agent、影像理解與自我驗證,並同步推出 xhigh effort、task budgets 和 /ultrareview。
Drew Breunig 從 Anthropic Mythos 與 AISI 評測出發,指出資安正變成一場 token 與金錢的消耗戰,開源軟體也因此更值得被認真守護。
Hacker News 上有用戶回報 Claude Code 2.1.107 的 OAuth 驗證卡在貼上授權碼那一步,連 tmux、ttyd、bash、VS Code 都收不到回傳,讓長時間運作的代理人直接失去登入能力。
Latent Space 這期從 Turkey problem、SWE-Bench 飽和、GDPval、Chrome Skills、Gemini Robotics、GPT-5.4-Cyber 到 Hermes Agent,整理出一個反直覺結論:AI 越強,知識工作者似乎越忙。
Adobe 為 Photoshop、Illustrator 與 Premiere Pro 等創意工具推出 Firefly AI 助理,讓使用者直接下指令完成跨軟體工作,並透過 connector 把能力延伸到 Anthropic Claude。
OpenAI 擴大 Trusted Access for Cyber,讓驗證過的防禦者可使用 GPT-5.4-Cyber,並以分級授權、KYC 與更少拒答邊界把資安能力推向實戰。
在 HumanX AI 會場上,Claude 成了企業與開發者最常被提起的名字,OpenAI 的聲量則明顯降溫,顯示代理與編碼工作流正在重新洗牌。
Google DeepMind 升級 Gemini Robotics-ER 1.6,把空間推理、多視角理解、儀表讀值與安全判斷整合進機器人工作流,讓具身推理更接近可部署。
Anthropic 與 OpenAI 都在把桌面介面往 superapp 方向重做,從任務面板、瀏覽器整合到多代理工作流,AI 產品競爭已不只是模型本身。
Simon Willison 研究 Servo 0.1.0 crate,驗證它能做 headless 截圖,也能把子套件編進 WebAssembly,讓瀏覽器引擎變成可嵌入工具箱。
OpenAI 收購個人理財新創 Hiro,等於把一套面向消費者的 AI 財務規劃工作流和創辦人團隊一起收入版圖,金融場景布局再往前推一步。
OpenAI、Anthropic 與 Google 透過 Frontier Model Forum 共享安全情報,試圖阻擋對手以對抗式蒸餾複製模型,也暴露出 API 商業模式的脆弱性。
OpenAI、Anthropic、Google 都在把 AI coding 推成核心戰場,開發者工作流、價格與產品整合正在重塑軟體產業。
回頭看,AI 2027 的時間點確實偏樂觀,但更值得注意的是,能力提升、驗證落差與權力集中正在一起改寫未來,也重塑誰能定義進步。
Meta 推出 Muse Spark,作為 Meta Superintelligence Labs 的首發模型,並把多代理推理、健康問答與視覺 STEM 能力,放進新一輪 AI 產品重整。
Simon Willison 實測 Gemma 4 E2B 搭配 MLX,在 macOS 上直接把 .wav 檔轉成文字;雖然辨識還會把 right 聽成 front,但已經足以看出本地多模態模型的實用性。
Ramp 數據顯示,Anthropic 在企業 AI 支出占比快速攀升,已逼近 OpenAI。Claude Code 在軟體圈的熱度,和它在美國國防部事件中的立場,也一起推升了採用率。
OpenAI 證實其 macOS 簽章流程曾接觸到被污染的 Axios 套件,但目前沒有跡象顯示用戶資料、系統資產或原始碼遭到外洩。
Simon Willison 指出,ChatGPT 的語音模式並不是最強模型,而是較舊、較弱的 GPT-4o 世代模型,這解釋了為什麼語音體驗常常和文字模式有明顯落差。
OpenAI 與 NCMEC、各州檢察長及 Thorn 共同提出兒童安全藍圖,主打修法、通報與系統內建防線,試圖在 AI 兒少性剝削風險擴大前先補上漏洞。
Meta 的超級智慧團隊推出首款閉源模型 Muse Spark,主打小而快,先放進 Meta AI,再逐步接手 WhatsApp、Instagram、Facebook 與智慧眼鏡。
Suno 與 Universal、Sony 的授權談判卡關,AI 生成音樂怎麼分享、下載與分潤,正變成產業最難談的一題。
OpenAI 新設 Safety Fellowship,提供月薪、算力與導師資源,邀請外部研究者投入 AI 安全、對齊、代理監督與高風險誤用研究。
OpenAI 公布一份政策藍圖,主張用主權基金、稅制重分配與四日工時等手段,替 AI 造成的經濟震盪先做準備。
GLM-5.1 不只會畫鵜鶘騎車的 SVG,還能看出動畫為何把版面弄壞,並自己修好 HTML/CSS。
花旗把 AI 用在舊系統資料搬遷、程式自動化與客戶開戶流程,已把文件審查時間從 1 小時壓到 15 分鐘,並持續縮減外包依賴。
Astropad 推出 Workbench,把遠端桌面改成專門監控 AI 代理的工具,主打 iPhone/iPad 連線、高畫質串流、語音輸入與多裝置切換。
Anthropic 把未公開的 Claude Mythos Preview 先放進 Project Glasswing,讓合作夥伴用它找漏洞、修補關鍵軟體,也同步面對 AI 資安雙重用途問題。
Meta 據報將為下一代 AI 模型推出開源版本,但功能可能不完整,顯示它在開源與商業化之間重新調整策略。
Anthropic 開始限制 OpenClaw 等第三方代理框架使用 Claude 的訂閱額度,改為另計用量費,顯示代理工具的商業模式正在快速收緊。
Anthropic 與 Google、Broadcom 簽下多 GW TPU 合作,預計 2027 年起上線,顯示 Claude 的需求已推到基礎建設等級。
NVIDIA 以 National Robotics Week 為主題,展示 physical AI 如何從模擬、合成資料一路走向農業等真實部署。
日本因缺工與高齡化加速導入 physical AI,從工廠、倉儲到基礎設施都在從試點走向落地,價值重心也從硬體轉向整合與部署。
創作者與媒體開始推動『人類製作』標章,希望在 AI 內容與合成媒體氾濫的時代,替文字、圖片、音訊與影片建立可驗證的真實性與來源證明。
Google 的 AI Edge Gallery 讓 iPhone 可離線跑 Gemma 4,還支援圖片問答、音訊轉錄與工具呼叫 demo,展示端側 AI 的實用樣貌。
Lalit Maganti 分享他如何用 AI coding agents 在三個月內做出 syntaqlite,也坦白 vibe-coding、重寫與架構失控的代價。
Reuters 報導,英國正趁 Anthropic 與美國國防部的衝突,試圖吸引它在英國擴編,甚至把雙重上市也列入方案。
生成式 AI 讓虛擬試穿更逼真,也讓零售商多了一條對抗高退貨率、守住毛利的路,但它仍然不是萬靈丹。
賓州大學研究顯示,面對 LLM 的流暢答案,人們常直接接受錯誤結論,73.2% 的錯誤推理都沒被擋下,顯示『認知投降』正在蔓延。
Anthropic 宣布 Claude Code 訂閱額度不再適用於 OpenClaw 等第三方工具,改走額外用量或 API 計費。這等於把原本被訂閱補貼的 agent 流量,正式拉回單獨計價。
印度電影工作室大規模導入 AI,從神話題材、配音到舊片重剪都在改寫製作成本與產能,也引發觀眾對品質與創意的拉扯。
Enable Security 指出,AI agents 已能在大型 C/C++ RTC 程式碼庫中自動找出零日漏洞,讓資安團隊的瓶頸從「發現問題」迅速轉向「消化問題」與快速修補。
OpenAI 宣布收購科技業界脫口秀 TBPN,這是這家 AI 巨頭首度跨入媒體版圖。TBPN 將保有編輯獨立性,由 OpenAI 策略長 Chris Lehane 管轄,此舉引發外界對 AI 輿論生態的廣泛討論。
首個基於掩碼擴散架構的全模態(Omnimodal)基礎模型 Dynin-Omni 正式發布,統一了文本、圖像、視頻與語音的理解與生成,標誌著生成式 AI 從自回歸範式向更高效擴散架構的重大轉型。
PrismML 推出首款商用 1-bit LLM『Bonsai 8B』,將 80 億參數模型壓縮至 1.15GB,速度提升 8 倍且能耗降低 80%,實現邊緣裝置運行強大 AI 的突破。
微軟推出 MAI-Transcribe-1、MAI-Voice-1、MAI-Image-2 三款模型,主打語音辨識、語音生成與圖像生成,瞄準企業級市場。
AI 大神 Karpathy 分享如何用 LLM + Obsidian 建立個人知識庫,反駁「小規模不需要 RAG」的直覺,強調 LLM 自己維護結構比預設 fancy tool 更有性價比。
Google DeepMind 推出 Gemma 4 四款開放模型,基於 Gemini 3,支援多模態輸入與 256K 上下文,Apache 2.0 授權,覆蓋邊緣到伺服器全場景。
vLLM 以 PagedAttention 突破記憶體瓶頸,Model Runner V2 吞吐量提升 56%,成為開源 LLM 推論標準框架。
Runway 砸 1000 萬美元成立創投基金,鎖定早期 AI、媒體與世界模擬新創,同步推出 Builders 計畫提供 50 萬 API credits。
Mistral 發布首款 TTS 模型 Voxtral TTS,4B 參數、9 種語言、情緒感知與低延遲串流,定價每千字 $0.016,Hugging Face 開放權重版本已上架。
微軟為 Copilot 引入「Critique」功能,由 GPT 生成、Claude 驗證,打造多 AI 相互把關的協作架構,並支援多模型並列比較的「Council」模式。
Anthropic 工程師用 GAN 啟發的三代理架構突破 AI 編碼瓶頸:規劃器 + 生成器 + 評估器,實現多小時無人介入的全端開發。
Anthropic 因錯誤的 .npmignore 設定,導致 59.8 MB 的 source map 被上傳至 npm,512,000 行 TypeScript 程式碼與 44 個隱藏功能旗標就此曝光。
Jack Dorsey 與 Sequoia 聯名主張 AI 取代資訊路由。Block 裁員 4000 人,以「世界模型」取代中層管理,重寫組織運作邏輯。
Anthropic 對 80,508 名 Claude 使用者做了史上最大規模的多語質性訪談,整理出人們對 AI 的九大期待與六種已經發生的回饋。
OpenAI 正式宣布完成 1220 億美元的融資,估值衝上 8520 億美元,並透露其每月營收已達 20 億美元。這筆資金將用於晶片、資料中心與 Coding Agent 研發,標誌著 OpenAI 邁向 IPO 與超大應用(Superapp)轉型的關鍵時刻。
Ethan Mollick 指出 AI 的瓶頸在介面而非模型。聊天機器人造成認知負擔,Claude Cowork + Dispatch 代表新的代理介面方向。
Perplexity 分享語音代理實戰:context 分塊增量、音訊標準化、VAD 抗噪音、工具輸出保持 in-distribution。
2026 年 3 月 LLM 版圖:GPT-5.4 並列榜首,MoE 架構成主流,Mistral Small 4 以 6.5B 活躍參數展現效率。
AI coding agent 最新戰況:harness 競賽、本地推論崛起、模型廠商與工具鏈整合,真正的主線是部署與工作流模式的創新。
Claude Code 創辦人 Boris Cherny 分享 15 個被低估的功能,涵蓋手機端、遠端接手、定時自動化、hooks、worktrees、batch 與語音編程。
中國 LLM 版圖多層重構:ByteDance 靠分發稱霸消費者層,Qwen 與 DeepSeek 在開源圈引領風潮,下個戰場是誰成為 Claude Code 預設後端。
Anthropic CMS 設定錯誤,意外暴露近 3,000 份內部文件。新 tier Capybara 將居於 Opus 之上,被形容為「step change」與公司史上最強。
George London 主張,AI coding agent 正把自由軟體從程式人的抽象權利,變成一般使用者也能實際行使的客製化能力。
OpenAI 收購 Astral,將 uv、Ruff、ty 等 Python 開源工具整合進 Codex 生態,顯示 AI 開發賽道從寫程式走向管理整個工具鏈。
用 28,000 本維多利亞時代書籍、29.3 億 tokens 訓練的 340M 小模型,Simon Willison 實際跑過結論是「很弱,但很有趣」。
LiteLLM 1.82.8 被植入惡意程式,46 分鐘近 47,000 次下載。作者與 Claude Code 即時對話實錄,記錄從發現到公開揭露的過程。
Google DeepMind 以認知科學為基礎建立 AGI 評估框架,識別 10 項核心能力,並與 Kaggle 合辦 20 萬美元黑客松。
Copilot 被發現自動在用戶 PR 插入 Raycast 廣告,引爆 HN 討論。微軟緊急停用,但 AI 工具「腐化曲線」爭議持續。
AI 時代,公開你的想法可能正在餵養吃掉你的怪物。借用《黑暗森林》理論,探討 AI 如何將整個網路變成吸收創新者的認知黑洞。
研究者逆向工程 ChatGPT 的 Cloudflare Turnstile 機制,解密 377 支程式後發現:每次輸入前都會蒐集 55 個瀏覽器屬性,包含 GPU、字型、地理位置,甚至 React 應用程式的內部狀態——機器人防護已進化到應用層。
為什麼用 Obsidian markdown 當 AI 記憶系統是根本性的誤解——資料庫存知識、markdown 存指令,別搞混。
Stanford 測試 11 款 LLM 的個人建議回應,發現多數模型的肯定率高於人類基準,AI 諂媚源自 RLHF 訓練結構而非偶然。
OpenAI 用 GPT-5.4 驅動的即時監控系統,偵測內部 coding agent 的錯位行為,五個月內分析數千萬條軌跡。
深入解析 OpenAI Model Spec 的哲學與機制:指令鏈架構、不可覆寫紅線,以及與 Anthropic Constitution 的差異。
Google TurboQuant 將 LLM 的 KV Cache 壓縮 6 倍,零精度損失、免重訓練,社群已推出三種開源實作。
agent-browser 兩個月衝破 21,000 星,真正戳中的不是 browser automation,而是 agentic coding 最痛的驗證瓶頸。
Anthropic 分享 Claude Code 的 prompt caching 架構心得:前綴匹配、快取命中率監控,以及常見的快取失效陷阱。
OpenAI Cookbook 提出 Evaluation Flywheel 方法:透過分析、量測、改進的迭代循環,系統化打造穩健的 prompt。
用 Claude Code 建立 8 個平行 agent 全面自動化生活,從一夜打造千萬人使用的工具到父母學會命令列的真實故事。
The Batch 本週重點:Claude Opus 4.6 推理能力躍進、xAI 與 SpaceX 合作、AI 診斷超越醫生、標準化 AI 審計框架。