Skip to Content Facebook Feature Image

Inception推Mercury 2.5擴散式語言模型 智能速度成本全面提升

商業事

Inception推Mercury 2.5擴散式語言模型 智能速度成本全面提升
商業事

商業事

Inception推Mercury 2.5擴散式語言模型 智能速度成本全面提升

2026年09月09日 00:30 最後更新:00:48

Inception公司今日宣布推出Mercury 2.5。該公司是首個商用擴散式大型語言模型(dLLM)的開發商。Mercury 2.5是目前生產中最具能力及推理速度最快的dLLM。Mercury 2.5為dLLM帶來更高層次的智能,在生產環境下每秒可處理超1,100個詞元。

現時大部分生產中的大型語言模型,仍以自迴歸方式逐個詞元生成文本。這種方法將成本及延遲直接與推理深度掛鈎,模型思考得越多,速度便越慢,成本亦越高。dLLM的運作方式不同,它會先生成輸出的草稿,然後並行地精煉詞元。

Inception推出Mercury 2.5,為擴散式大型語言模型帶來更高層次的智能。 AP圖片

Inception推出Mercury 2.5,為擴散式大型語言模型帶來更高層次的智能。 AP圖片

dLLM已從研究階段的嘗試,發展成為生產環境中的主力。企業對Mercury的使用量正以超十倍的速度增長,大規模地支援搜尋、語音及編碼代理。Inception透過Mercury 2證明擴散式模型已為企業應用做好準備,其智能水平與Claude Haiku及GPT Mini相若,但吞吐量卻高出約十倍。自此,Mercury模型已成為那些不願犧牲智能換取速度,或犧牲速度換取成本的團隊首選dLLM。Mercury 2.5直接建基於此基礎:提供更高智能、更低成本,並較傳統模型有相同的速度提升。

Inception行政總裁兼聯合創辦人埃蒙表示:「業界沒有人認為大型語言模型可以同時變得更智能、更快、更便宜。這是自迴歸建模的局限。Mercury 2.5證明轉用擴散式模型可開啟這扇門。」

詞元效率

隨着人工智能基礎設施成本上升,數據中心難以應付需求,詞元效率受到比一年前更嚴格的審視。每個詞元均涉及運算、電力及數據中心容量成本,而自迴歸模型在逐個詞元生成時,會耗用這三項資源。dLLM能更有效地利用每個圖像處理器週期,每一步生成多個詞元而非一個,意味每單位成本可獲取更高智能。這種效率可在廣泛使用的英偉達圖像處理器上運行,而非專用晶片。

更智能,不減速

Mercury 2.5的智能水平較Mercury 2提升十點,使其超越所有以往的dLLM,可媲美GPT-5.6 Luna、Gemini 3.5 Flash-Lite及Claude Haiku 4.5等成本優化型前沿模型。吞吐量增至每秒超1,100個詞元,定價降至每百萬詞元0.20美元/0.75美元。推出時,Mercury 2.5提供八折優惠,每百萬詞元僅0.04美元/0.15美元。Mercury 2.5將上下文窗口擴展至260K詞元,較原來的128K有所增加,並新增可調推理、原生工具使用、JSON模式及並行工具調用功能。

OpenCall聯合創辦人兼行政總裁西爾弗斯坦表示:「轉用Mercury後,我們的P99響應時間從數分鐘降至僅一秒,P50則從0.4秒降至不足0.2秒,較市場上包括推理功能在內的其他供應商更快。」

擴散式模型蓬勃發展的領域

Mercury dLLM已在要求響應式推理的工作負載中投入生產:

除Mercury 2.5外,Inception亦宣布推出Mercury Voice及Mercury Router的預覽版。Mercury Voice可在170毫秒內提供首個詞元時間(TTFT),是一款為延遲預算最嚴格的語音代理優化的dLLM。Mercury Router則利用dLLM理解輸入提示,並將其路由至提供最佳質量、速度及成本組合的模型(包括開源及閉源模型)。有興趣的客戶可聯絡sales@inceptionlabs.ai以獲取Mercury Voice及Mercury Router的預覽權限。

Mercury 2.5已為企業應用做好準備,現已透過Inception的API、OpenRouter及Baseten提供。用戶可獲取一億個免費詞元以開始使用。

關於Inception

Inception開發基於擴散式的大型語言模型(dLLM),旨在實現高效、低延遲的人工智能應用。傳統的自迴歸式大型語言模型按順序生成文本,而Inception的擴散式模型則並行生成輸出,從而為搜尋、語音及編碼代理等實時應用場景提供更快的推理速度及更高的可靠性。Inception的Mercury模型可透過Inception API、OpenRouter及Baseten獲取。Inception總部設於加州紅木城,獲Menlo Ventures、Mayfield、Innovation Endeavors、M12(微軟的風險投資基金)、Snowflake Ventures、Databricks Ventures等機構,以及吳恩達、安德烈·卡帕西及埃里克·施密特等個人投資者支持。如欲了解更多資訊,請瀏覽www.inceptionlabs.ai。

(美聯社)

語音平台「顧華」(Guava)今日宣布,其生產語音代理現已透過CarrierX的電訊網絡,提供AMR-WB 16千赫寬頻音訊服務。這次合作旨在為醫療保健、金融服務、保險及其他受規管行業的企業提供服務。

語音通話必須在嚴格的延遲預算內運作。當人工智能代理回應過慢時,來電者可能會插話、重複自己或掛斷電話。通話音訊通常會經過多個網絡中介,才能到達人工智能系統,而每個跳轉都會增加延遲。

「顧華」與CarrierX將16千赫高清語音引入實時客戶通話 AP圖片

「顧華」與CarrierX將16千赫高清語音引入實時客戶通話 AP圖片

CarrierX擁有並營運其自身的電訊網絡基礎設施,具備直接發起及終止通話功能,因此通話能以較少跳轉及減少額外延遲,到達「顧華」的代理。

「顧華」將節省的延遲分配予更大的推理模型,從而提高代理在複雜通話中的可靠性,同時保持少於一秒的端到端通話延遲,以及少於200毫秒的輪流發言延遲。這些模型是根據受規管生產環境中,超過100億分鐘的實時代理通話訓練而成。

這種架構亦簡化了安全審查。較少中介意味著合規團隊首先提出的問題——通話數據流向何處——能得到更簡潔的答案。「顧華」已獲SOC 2 Type II 認證、HITRUST i1 認證及PCI DSS Level 1 合規,並可為醫療保健部署提供業務夥伴協議。CarrierX的網絡在超過160個國家,以99.99%的正常運行時間運作,每月處理超過20億次通話。

AMR-WB 16千赫標準提供的音訊頻寬,大約是傳統窄頻電話的兩倍。CarrierX的網絡專門為支援高清音訊而構建,包括為舊有系統轉碼。

「顧華」聯合創辦人安東尼·斯科達里表示,CarrierX透過其電訊網絡基礎設施實現的低延遲,為他們提供了用於推理模型的延遲預算。該預算直接轉化為可靠性,這對於受規管行業的通話而言是最重要的指標。

CarrierX創辦人兼行政總裁大衛·艾瑞克森指出,他一直倡導最高共通標準語音,「顧華」使用其網絡,正是這種價值所在的最佳例證。他們在最高質素訊號上實現了最低延遲,而直接連接使其最安全。在人工智能及運算領域,每毫秒都至關重要,這次合作證明了這一點。

「顧華」是為受規管行業而設的語音平台,專為必須準確無誤的通話而建。這是一個統一系統,涵蓋語音識別(ASR)、大型語言模型(LLM)、文字轉語音(TTS)、對話控制、合規引擎及監督代理,自2013年起已進行超過100個受規管部署,客戶可在啟動後14天內上線。該公司已獲SOC 2 Type II、HITRUST i1及PCI DSS Level 1認證。

CarrierX是一家雲端通訊及CPaaS電訊商,建基於其自身的全球網絡。該網絡讓開發人員可將高清語音、短訊、聊天、視像及進階路由直接嵌入其應用程式,而其電訊商交換平台則將大型電訊商及虛擬流動網絡營辦商(MVNOs)直接且安全地連接到這些應用程式。

(美聯社)

你 或 有 興 趣 的 文 章