中國電信突破千億參數(shù)大模型500公里聯(lián)合訓(xùn)練,為AI基礎(chǔ)設(shè)施協(xié)同發(fā)展提供新方案

極客網(wǎng)·人工智能 近日,中國電信在人工智能基礎(chǔ)設(shè)施領(lǐng)域取得重大突破,率先完成了1024卡千億參數(shù)大模型的500公里分布式聯(lián)合訓(xùn)練試商用。這一成果不僅為AI大模型的高效訓(xùn)練提供了新的技術(shù)路徑,也為我國“東數(shù)西算”等國家戰(zhàn)略工程的落地提供了有力支持。

核心技術(shù)突破:長距離、大帶寬、低延遲的算力協(xié)同

此次試商用的核心挑戰(zhàn)在于如何實現(xiàn)長距離、大帶寬、低延遲的算力協(xié)同。中國電信通過自主研發(fā)的“廣域智聯(lián)無損網(wǎng)絡(luò)”技術(shù),在天津武清至北京瀛海之間構(gòu)建了一張長達500公里的真實光路環(huán)回網(wǎng)絡(luò)。這一網(wǎng)絡(luò)成功將千億參數(shù)大模型的分布式訓(xùn)練性能提升至單數(shù)據(jù)中心效能的97%以上,幾乎達到了與本地數(shù)據(jù)中心相當(dāng)?shù)挠?xùn)練效率。

據(jù)北京電信相關(guān)負責(zé)人王軼介紹,關(guān)鍵技術(shù)亮點在于采用800G廣域無損傳輸技術(shù),將帶寬收斂比提升至32:1,有效解決了長距離傳輸中因網(wǎng)絡(luò)擁塞導(dǎo)致的丟包問題。王軼表示:“通過WSON(光波長保護)技術(shù),我們實現(xiàn)了鏈路中斷的無感知切換,保障了訓(xùn)練的連續(xù)性與穩(wěn)定性,切換時間僅為50毫秒,幾乎可以忽略不計?!?/p>

智算平臺賦能:提升部署效率與商用價值

除了網(wǎng)絡(luò)技術(shù)的突破,中國電信還利用“息壤”智算平臺,集成了跨地域算網(wǎng)協(xié)同、自動并行、斷點續(xù)訓(xùn)等功能。這一平臺能夠?qū)崿F(xiàn)故障秒級定位與分鐘級恢復(fù),大幅提升商用模型的部署效率。通過這些技術(shù)手段,中國電信不僅優(yōu)化了大模型的訓(xùn)練過程,還為AI基礎(chǔ)設(shè)施的協(xié)同發(fā)展提供了新的思路。

解決傳統(tǒng)模式痛點,推動“東數(shù)西算”落地

當(dāng)前,AI大模型訓(xùn)練對算力的需求呈指數(shù)級增長。然而,傳統(tǒng)單數(shù)據(jù)中心模式受限于物理空間、能源成本與地域限制,難以滿足日益增長的算力需求。中國電信此次突破的核心價值在于,通過跨地域算力整合,將分散的數(shù)據(jù)中心轉(zhuǎn)化為“虛擬超級計算機”,極大降低了訓(xùn)練成本,同時為“東數(shù)西算”等國家工程提供了可落地的技術(shù)路徑。

“東數(shù)西算”工程旨在將東部地區(qū)的數(shù)據(jù)計算需求轉(zhuǎn)移到西部地區(qū),充分利用西部的能源和算力資源。中國電信的500公里聯(lián)合訓(xùn)練技術(shù)為這一工程提供了重要的技術(shù)支撐,使得跨地域算力調(diào)度更加高效、穩(wěn)定。

(免責(zé)聲明:本網(wǎng)站內(nèi)容主要來自原創(chuàng)、合作伙伴供稿和第三方自媒體作者投稿,凡在本網(wǎng)站出現(xiàn)的信息,均僅供參考。本網(wǎng)站將盡力確保所提供信息的準確性及可靠性,但不保證有關(guān)資料的準確性及可靠性,讀者在使用前請進一步核實,并對任何自主決定的行為負責(zé)。本網(wǎng)站對有關(guān)資料所引致的錯誤、不確或遺漏,概不負任何法律責(zé)任。
任何單位或個人認為本網(wǎng)站中的網(wǎng)頁或鏈接內(nèi)容可能涉嫌侵犯其知識產(chǎn)權(quán)或存在不實內(nèi)容時,應(yīng)及時向本網(wǎng)站提出書面權(quán)利通知或不實情況說明,并提供身份證明、權(quán)屬證明及詳細侵權(quán)或不實情況證明。本網(wǎng)站在收到上述法律文件后,將會依法盡快聯(lián)系相關(guān)文章源頭核實,溝通刪除相關(guān)內(nèi)容或斷開相關(guān)鏈接。 )

贊助商
2025-02-21
中國電信突破千億參數(shù)大模型500公里聯(lián)合訓(xùn)練,為AI基礎(chǔ)設(shè)施協(xié)同發(fā)展提供新方案
長距離、大帶寬、低延遲的算力協(xié)同

長按掃碼 閱讀全文