阿里同週推出兩個語音入口:一條做內容,一個接服務
三天之內,阿里接連推出兩款語音產品。 8月7日,CosyVoice Studio 亮相;8月10日,千問開放平台上線。 看起來都是語音入口,落刀的位置完全不同:前者負責把語音能力做成內容和工具,後者要把第三方服務直接帶進對話。
一個管生產,一個管服務抵達用戶。 開發者該從哪裡入手,答案就藏在這層分工裡。
CosyVoice Studio:先把語音做成可交付的結果
CosyVoice Studio 整合了語音辨識、語音合成和即時語音交互,產品結構涵蓋「聽、創、聊」三類場景。 它不只是提供一組模型接口,還把常見工作流程直接做進了平台。
阿里稱之為「國內首個 AI 語音生產力平台」。 拋開這一宣傳口徑,產品變化仍然清晰:過去,識別、摘要、合成往往分散在不同工具裡,開發者還要自己處理格式、上下文和調用順序;Studio 把這些步驟串成可重複的流程,用戶拿到的不再是一次模型返回,而是一份接近成品的結果。
例如,在 CosyCreative 的演示中,用戶把一期「極客早知道」的文字放進系統,完成簡單設定後,平台先生成內容摘要,再轉成語音播報。 整個過程大約一分鐘。 原本需要摘要、配音和後期銜接的幾道工序,被壓縮進同一個頁面。
平台目前分為三個方向:CosyFlow 面向個人效率,CosyCreative 用於內容生產和聲音創作,CosyAgent 則服務企業智能體。 這樣的劃分很務實:個人使用者可以直接處理內容,企業可以把語音 Agent 連結到知識庫、業務系統和工作流程。
三條產品線也對應三種不同的付費和使用情境。 個人用戶看重的是節省整理、記錄和收聽時間;內容團隊關心聲音生產能否穩定復用;企業客戶則要考慮權限、知識庫和流程系統能不能打通。 語音效果只是起點,平台最終比拼的是整個工作鏈能否持續運作。
CosyAgent 更能說明這款產品的定位。 語音在這裡不只是輸入方式。 系統理解需求後,也要呼叫企業已有的能力完成後續操作。 能否接進真實業務,才是它與一般語音工具的分界線。
企業存取也比一次產品展示複雜得多。 知識庫內容是否更新、業務系統能否穩定返回、工作流程發生異常後如何交給人工,都影響最終可用性。 Studio 把開發入口收攏到一個平台,可以降低前期拼裝成本,但要從“能演示”走到“能長期使用”,仍要靠企業自己的數據與流程治理。
千問開放平台:讓服務留在對話裡完成
千問開放平台走的是另一條路。 第三方可以創建獨立的 AI 智能體,在千問 App 內提供諮詢、推薦和履約服務。 使用者透過 @相關服務,或點擊右上角的「圓點角標」,即可進入對應的對話空間。
過去,使用者在聊天中獲得建議後,往往還要跳到另一個應用程式完成操作。 千問希望把這段連結留在對話裡。 對服務商來說,接取的重點也隨之改變:不僅要回答問題,還要把諮詢、推薦和實際履約連結起來。
這對第三方提出了更高要求。 一個智能體能夠回答“有什麼可選”,並不代表它能處理庫存、訂單、付款或售後。 千問開放平台強調從諮詢走到履約,說明平台想承接的不是簡單的訊息問答,而是一條完整服務鏈。 服務商能否把後台能力接穩,會直接決定使用者體驗。
開放範圍不限於手機。 千問開放平台同時支援手機、PC 和 AI 眼鏡,並為眼鏡端提供 Skill 存取和業界客製化兩種模式。 開發者可以用自然語言自訂 Skill。
官方舉例稱,開發者可以調用「眼鏡拍照」能力,為視障人士製作「身邊有什麼」Skill,識別並提醒門檻、台階等障礙物。 到了這一步,語音互動已經進入具體環境,不再只是手機裡的問答框。
眼鏡端也提供 Skill 接取和業界客製化兩種模式。 前者降低開發門檻,後者則為更複雜的產業場景留出空間。 手機、PC 和眼鏡共用服務入口後,同一個智慧體有機會跨裝置延續任務;但辨識準確率、反應速度和隱私處理,也會比一般聊天場景更受考驗。
阿里在同一周推出這兩款產品,方向其實很清楚。 CosyVoice Studio 解決“怎麼把語音能力做出來”,千問開放平台解決“怎麼讓用戶在對話裡用起來”。 前者偏生产,后者偏分发和履约。 開發者需要判斷的,也只是目前更缺哪一環。
兩條路線未來也可能匯合:工作台生產出的語音能力,可以成為服務智能體的一部分;千問提供的多終端入口,又能把這些能力送到更具體的場景。 眼下,兩款產品仍各有重點。 對內容團隊,先看生成品質和製作效率;對服務商,要先確認履約鍊是否真的能留在對話裡完成。
*封面圖片來源:極客公園報導頁 / Flickr。 *
登入回覆
登入分享您的看法評論
相關文章