AI 領域精選文章翻譯
by Naomi Moneypenny (Microsoft)

原文連結: Introducing MAI-Transcribe-1, MAI-Voice-1, and MAI-Image-2 in Microsoft Foundry
自成立以來,微軟 Foundry 的目標一直是提供最完整的 AI 與應用智能體工廠;讓開發者能夠存取最新的前沿模型、工具、基礎架構、安全性與可靠性,從而自信地構建與擴展其 AI 解決方案。
今天,微軟朝著這一願景邁出了另一步,宣佈在 Microsoft Foundry 中公開預覽微軟 AI 的三款新模型:
這些模型與目前支援 Copilot、Bing、PowerPoint 和 Azure Speech 的模型相同,現在專供 Foundry 開發者使用。
語音正迅速成為下一代 AI 智能體的主要介面,而構建卓越的語音體驗需要能夠精準聽說的模型。透過 MAI-Voice-1 與 MAI-Transcribe-1,微軟提供了專為開發者打造的完整音訊 AI 堆疊。
MAI-Voice-1 是極速的語音生成模型,這使其成為當今最高效的語音系統之一。在聽覺方面,MAI-Transcribe-1 針對口音、語言與真實世界的音訊環境進行了優化,具備企業級可靠性。與領先的轉錄模型相比,MAI-Transcribe-1 在提供競爭力準確度的同時,GPU 成本幾乎減半,這一優勢直接轉化為企業更可預測且具擴展性的定價。
應用場景:
圖像位於開發者構建引人入勝的 AI 驅動創意體驗(從行銷工具到內容平台再到多模態智能體)的核心。MAI-Image-2 是微軟對這一需求的回答。
該模型是與攝影師、設計師和視覺敘事者密切合作開發的,在 Arena.ai 排行榜上名列前茅。它提升了在真實創意工作流中最重要的能力:更自然的光影、逼真的圖像生成、更強的圖中文字渲染(適用於資訊圖表與圖表),以及在複雜佈局、細節場景與電影視覺效果上的精確度。
全球最大的行銷與傳播集團之一 WPP 已成為首批大規模應用 MAI-Image-2 的企業合作夥伴,將其用於驅動先前需要大量手動工作的創意生產工作流。
微軟致力於將「以人為本」的 AI(Humanist AI)帶入每個人的口袋,讓每個人都擁有一個真正世界級、對其負責且符合其利益的 AI 助手。
微軟這次發佈的三款模型,標誌著雲端巨頭不再滿足於僅提供第三方模型,而是開始將自家產品(如 Copilot)底層最強大的基礎能力直接開放給開發者。
對於開發者來說,這是一個重大的轉向信號:
這三款模型的推出,將進一步壓縮中小型 AI 模型廠商的生存空間,同時也迫使其他雲端供應商必須提供更高性價比的原生模型來應對。