近年來(lái),云GPU的部署改變了團(tuán)隊(duì)處理人工智能和機(jī)器學(xué)習(xí)等計(jì)算密集型工作的方式。它為你提供并行處理能力,無(wú)需購(gòu)買(mǎi)硬件、配置服務(wù)器機(jī)房,或管理聽(tīng)起來(lái)像小型飛機(jī)起飛的冷卻系統(tǒng)。
GPU云計(jì)算之所以有效,是因?yàn)?/span>GPU處理計(jì)算的方式不同于CPU。成千上萬(wàn)的計(jì)算同時(shí)發(fā)生。當(dāng)你訓(xùn)練神經(jīng)網(wǎng)絡(luò)、處理數(shù)TB數(shù)據(jù),或運(yùn)行需要答案的金融模型時(shí),這種架構(gòu)極其重要。通過(guò)云基礎(chǔ)設(shè)施進(jìn)行GPU處理,能在你需要時(shí)提供計(jì)算能力,并根據(jù)項(xiàng)目需求進(jìn)行擴(kuò)展。無(wú)論你是開(kāi)發(fā)者、云架構(gòu)師,還是運(yùn)營(yíng)DevOps團(tuán)隊(duì),這篇文章都有重要的見(jiàn)解。
優(yōu)勢(shì)很快就顯現(xiàn)出來(lái)。云可擴(kuò)展性是在訓(xùn)練運(yùn)行需要時(shí)添加GPU,完成后再逐步縮減。你付的是你用的東西。GPU加速將處理時(shí)間從幾天縮短到數(shù)小時(shí)。虛擬GPU資源配置只需幾分鐘。
云的靈活性消除了硬件作為你嘗試內(nèi)容的限制。多嘗試、迭代、快速失敗、前進(jìn)。沒(méi)有采購(gòu)周期阻礙進(jìn)展。你的團(tuán)隊(duì)在投入昂貴基礎(chǔ)設(shè)施投資前先測(cè)試想法,這從根本上改變了你驗(yàn)證某方法是否值得追求或需要放棄的速度。
虛擬GPU分配會(huì)根據(jù)實(shí)際需求進(jìn)行調(diào)整。例如,如果你在一夜間訓(xùn)練一個(gè)大型模型,你只需啟動(dòng)64塊GPU。第二天早上又回去做開(kāi)發(fā)工作?很容易縮減到兩個(gè)。
按需付費(fèi)定價(jià)消除了固定基礎(chǔ)設(shè)施中內(nèi)置的浪費(fèi)。你不需要為團(tuán)隊(duì)休息時(shí)閑置的容量付費(fèi)。云成本優(yōu)化是自動(dòng)發(fā)生的,因?yàn)樵瀑Y源會(huì)隨著工作負(fù)載的擴(kuò)展和收縮而變化。GPU性能是根據(jù)你的預(yù)算和時(shí)間表調(diào)整的,而不是你一開(kāi)始能負(fù)擔(dān)多少硬件。
對(duì)于同時(shí)探索多種方法的研究團(tuán)隊(duì),或在有限的市場(chǎng)契合度測(cè)試初創(chuàng)企業(yè)來(lái)說(shuō),這種靈活性是一個(gè)真正的游戲規(guī)則改變者,往往決定了雄心勃勃項(xiàng)目是否能實(shí)現(xiàn)。
簡(jiǎn)單來(lái)說(shuō),GPU和CPU的思維方式不同。這使得他們更適合不同類型的工作。
CPU擅長(zhǎng)復(fù)雜的邏輯和順序任務(wù),如遵循代碼中的復(fù)雜分支路徑、處理不可預(yù)測(cè)的控制流或管理系統(tǒng)資源。GPU擅長(zhǎng)同時(shí)在龐大的數(shù)據(jù)集中完成同樣的計(jì)算。這就是并行處理的體現(xiàn),這也是訓(xùn)練機(jī)器學(xué)習(xí)模型成為現(xiàn)實(shí)可能的原因。
GPU加速帶來(lái)了更高的吞吐量,因?yàn)閿?shù)千個(gè)核心同時(shí)處理作,而不是一個(gè)接一個(gè)地處理。當(dāng)你在數(shù)百萬(wàn)張圖像上訓(xùn)練模型時(shí),這些都是可以并行進(jìn)行的矩陣乘法。當(dāng)你的工作負(fù)載符合這種模式時(shí),加速計(jì)算是理想的選擇。如果不行,GPU幫不上什么忙,但對(duì)于AI工作負(fù)載來(lái)說(shuō),這種配合幾乎完美。
性能提升也會(huì)累積。更快的訓(xùn)練意味著更多的實(shí)驗(yàn)。更多的實(shí)驗(yàn)意味著更好的模型。高性能計(jì)算流程在CPU基礎(chǔ)設(shè)施上耗時(shí)數(shù)周,GPU幾天內(nèi)完成。這個(gè)時(shí)間差直接影響了你們團(tuán)隊(duì)的出貨速度。
有了云資源,你可以在不到一小時(shí)內(nèi)訂購(gòu)GPU實(shí)例、配置環(huán)境,并開(kāi)始訓(xùn)練運(yùn)行。
相比之下,購(gòu)買(mǎi)實(shí)體GPU——采購(gòu)審批、供應(yīng)商交貨、運(yùn)輸、安裝、驅(qū)動(dòng)配置、測(cè)試。至少要幾周。如果你的采購(gòu)流程涉及多層審批,或者在需求高峰期尋找特定GPU型號(hào),通常需要幾個(gè)月。更別提費(fèi)用了。
當(dāng)您需要今天就取得成果時(shí),云部署速度至關(guān)重要。云基礎(chǔ)設(shè)施完全消除了這些延遲。資源在你需要的那一刻就會(huì)自動(dòng)開(kāi)放。虛擬GPU配置意味著基礎(chǔ)設(shè)施支持實(shí)驗(yàn)而非限制,GPU虛擬化則允許你在不物理更換硬件的情況下調(diào)整規(guī)格。
共享云GPU環(huán)境消除了硬件作為測(cè)試限制的因素。你會(huì)嘗試更多方法,因?yàn)榉稿e(cuò)的代價(jià)會(huì)下降。一個(gè)失敗的實(shí)驗(yàn)只會(huì)花費(fèi)你幾個(gè)小時(shí)的計(jì)算時(shí)間,而不是需要多年合理化的資本支出。
這里的無(wú)障礙轉(zhuǎn)變被低估了。孟買(mǎi)的開(kāi)發(fā)者使用與硅谷研究人員相同的計(jì)算能力。兩者只為實(shí)際使用的部分付費(fèi)。十年前需要機(jī)構(gòu)資源的研究,現(xiàn)在卻只能靠信用卡進(jìn)行。想法很快就會(huì)被考驗(yàn)。從概念到驗(yàn)證成果的時(shí)間大幅縮短,云計(jì)算的優(yōu)勢(shì)最明顯體現(xiàn)在你能驗(yàn)證多少想法,然后再投入大量資源投入到單一方法上。
云服務(wù)還消除了地理障礙。通過(guò)互聯(lián)網(wǎng)連接訪問(wèn)云資源意味著分布式團(tuán)隊(duì)在相同的環(huán)境中工作。沒(méi)有版本不匹配。沒(méi)有浪費(fèi)半天時(shí)間的“在我機(jī)器上運(yùn)行”的調(diào)試會(huì)話。沒(méi)有系統(tǒng)間的數(shù)據(jù)傳輸,因?yàn)榇蠹乙呀?jīng)在同一基礎(chǔ)設(shè)施上工作。
云合規(guī)也會(huì)變得更容易,而不是更難。為了滿足數(shù)據(jù)駐留要求,部署在符合你法規(guī)的區(qū)域。對(duì)于安全要求,許多云服務(wù)提供商維護(hù)了審計(jì)師已經(jīng)認(rèn)可的認(rèn)證。
選擇云端存在自身的挑戰(zhàn)。云合規(guī)要求因行業(yè)、地區(qū)以及企業(yè)所遵循的具體法規(guī)而異。當(dāng)遺留代碼假設(shè)本地硬件具有特定特性時(shí),應(yīng)用兼容性尤為重要。云遷移規(guī)劃決定了遷移是否成功,還是最終導(dǎo)致昂貴且耗時(shí)的失敗,使團(tuán)隊(duì)倒退數(shù)月。
這些挑戰(zhàn)并非不可克服。它們只是需要規(guī)劃,而不是假設(shè)遷移是簡(jiǎn)單的。
當(dāng)法規(guī)規(guī)定數(shù)據(jù)處理必須在哪里進(jìn)行時(shí),云合規(guī)性會(huì)迅速變得復(fù)雜。
GDPR關(guān)注數(shù)據(jù)駐留。HIPAA對(duì)受保護(hù)的健康信息有具體要求。金融法規(guī)通常規(guī)定計(jì)算發(fā)生地點(diǎn)及誰(shuí)可以訪問(wèn)結(jié)果。云安全依賴于理解共同責(zé)任模型。云服務(wù)提供商負(fù)責(zé)保障基礎(chǔ)設(shè)施安全——物理安全、網(wǎng)絡(luò)安全、虛擬機(jī)監(jiān)控器隔離。你保護(hù)你的應(yīng)用程序、數(shù)據(jù)和訪問(wèn)控制。
這個(gè)界限很重要。誤解誰(shuí)負(fù)責(zé)什么的團(tuán)隊(duì),就會(huì)產(chǎn)生不該存在的漏洞。加密、訪問(wèn)控制、審計(jì)日志——這些都不是可選的附加功能。滿足監(jiān)管要求要求從第一天起就正確實(shí)施強(qiáng)有力的安全措施,而不是在審計(jì)發(fā)現(xiàn)問(wèn)題后才添加。
當(dāng)團(tuán)隊(duì)假設(shè)應(yīng)用程序“能在不同環(huán)境中正常工作”時(shí),云遷移就會(huì)失敗。
但實(shí)際上,他們往往沒(méi)有。GPU工作負(fù)載通常依賴于特定驅(qū)動(dòng)版本、CUDA工具包配置或庫(kù)兼容性,這些依賴無(wú)法在本地硬件和云實(shí)例之間自動(dòng)轉(zhuǎn)移。為特定硬件開(kāi)發(fā)的遺留應(yīng)用可能需要修改。云基礎(chǔ)設(shè)施處理存儲(chǔ)I/O的方式與本地部署不同。網(wǎng)絡(luò)延遲的表現(xiàn)則不同。對(duì)這些因素敏感的GPU工作負(fù)載需要調(diào)優(yōu)才能在遷移后表現(xiàn)出色。成功的云部署需要了解環(huán)境間的變化,并驗(yàn)證你的應(yīng)用仍然能以可接受的速度產(chǎn)生正確結(jié)果。
熟悉傳統(tǒng)基礎(chǔ)設(shè)施的IT團(tuán)隊(duì)常常在云原生開(kāi)發(fā)中遇到困難。云遷移需要新技能:容器化、編排、基礎(chǔ)設(shè)施即代碼,以及理解定價(jià)模型的實(shí)際運(yùn)作方式,以避免收到突發(fā)賬單。
并行處理優(yōu)化與傳統(tǒng)的順序編程方法有不同之處,如果你長(zhǎng)期從事單線程代碼編寫(xiě),這些差異并不明顯。
云服務(wù)不斷發(fā)展。六個(gè)月前有效的方案現(xiàn)在可能有更好的替代方案,成本更低、效果更快。團(tuán)隊(duì)需要持續(xù)的教育,否則將錯(cuò)過(guò)直接影響成本和績(jī)效的效率提升。組織面臨選擇:投資培訓(xùn)現(xiàn)有團(tuán)隊(duì),還是聘請(qǐng)已有云專業(yè)知識(shí)的人才。兩種方法都有效。這兩件事都不是一蹴可幾的。
GPU工作負(fù)載支持各行業(yè)的高計(jì)算任務(wù)。AI工作負(fù)載主導(dǎo)著當(dāng)前的使用,但應(yīng)用更多。高性能計(jì)算支持科學(xué)研究、金融建模、醫(yī)學(xué)影像和氣候模擬等。
深度學(xué)習(xí)和機(jī)器學(xué)習(xí)訓(xùn)練消耗大量GPU資源,但推理工作負(fù)載也是關(guān)鍵。藥物發(fā)現(xiàn)、自動(dòng)駕駛車(chē)輛模擬、蛋白質(zhì)折疊分析、視覺(jué)特效實(shí)時(shí)渲染——這些在單靠CPU上幾乎不可能或不切實(shí)際的工作負(fù)載,如今在云GPU上已成為常態(tài)。
神經(jīng)網(wǎng)絡(luò)訓(xùn)練處理數(shù)百萬(wàn)個(gè)樣本,涉及數(shù)十億參數(shù),根據(jù)錯(cuò)誤調(diào)整權(quán)重,重復(fù)直到模型趨同。計(jì)算的日子。有時(shí)幾周。這正是并行處理能極大加速的工作類型。深度學(xué)習(xí)GPU部署將訓(xùn)練時(shí)間從數(shù)周縮短到數(shù)天,甚至數(shù)天縮短至數(shù)小時(shí)。
機(jī)器學(xué)習(xí)GPU資源會(huì)根據(jù)模型大小和數(shù)據(jù)集量進(jìn)行擴(kuò)展。如果你在訓(xùn)練一個(gè)大型語(yǔ)言模型,你需要幾十塊GPU協(xié)同工作。客戶反饋的情感分析模型所需的GPU更少,但仍遠(yuǎn)快于僅用CPU訓(xùn)練。
處理大數(shù)據(jù)分析處理數(shù)TB的信息需要強(qiáng)大的計(jì)算能力。GPU加速了模式提取、相關(guān)分析和統(tǒng)計(jì)計(jì)算,將原始數(shù)據(jù)轉(zhuǎn)化為可作的洞見(jiàn)。
醫(yī)療應(yīng)用清楚地展示了這種影響。用于診斷的醫(yī)學(xué)圖像處理在GPU上速度極快。放射科醫(yī)生能更快地分析更多的掃描結(jié)果。研究團(tuán)隊(duì)處理數(shù)千張MRI圖像,發(fā)現(xiàn)了CPU需要數(shù)周才能發(fā)現(xiàn)的模式,從而更早、更準(zhǔn)確地識(shí)別疾病標(biāo)志。那些并行化良好的數(shù)據(jù)挖掘作——如聚類算法、降維、跨海量數(shù)據(jù)集的模式匹配——在GPU基礎(chǔ)設(shè)施上運(yùn)行速度快了幾個(gè)數(shù)量級(jí)。
這種速度提升改變了實(shí)際分析的內(nèi)容。那些因?yàn)橛?jì)算時(shí)間太長(zhǎng)而不值得提的問(wèn)題,在合理的時(shí)間內(nèi)都能得到答案。
隨著GPU通過(guò)云平臺(tái)普及,人工智能發(fā)展加速。看似純理論的機(jī)器學(xué)習(xí)模型因訓(xùn)練時(shí)間縮短至可行區(qū)間而變得實(shí)用。
人工智能應(yīng)用涵蓋圖像識(shí)別系統(tǒng)、識(shí)別照片中的物體、自然語(yǔ)言處理、理解多語(yǔ)言客戶查詢。
深度學(xué)習(xí)架構(gòu)驅(qū)動(dòng)推薦引擎、欺詐檢測(cè)系統(tǒng)和預(yù)測(cè)性維護(hù)模型,確保生產(chǎn)線正常運(yùn)行。大規(guī)模的神經(jīng)網(wǎng)絡(luò)訓(xùn)練需要GPU基礎(chǔ)設(shè)施。計(jì)算密度和并行處理能力使復(fù)雜人工智能系統(tǒng)具有經(jīng)濟(jì)可行性。五年前耗費(fèi)數(shù)百萬(wàn)美元計(jì)算資源的項(xiàng)目,現(xiàn)在運(yùn)行在云GPU實(shí)例上,成本數(shù)千美元。這種成本降低讓那些之前負(fù)擔(dān)不起AI開(kāi)發(fā)的組織也得以參與。
財(cái)務(wù)建模需要速度。市場(chǎng)變化很快。風(fēng)險(xiǎn)計(jì)算必須在機(jī)會(huì)消失或風(fēng)險(xiǎn)暴露限值被突破之前完成。
GPU能夠高效地處理這些計(jì)算的數(shù)學(xué)強(qiáng)度。金融工作負(fù)載從GPU并行處理中受益匪淺。預(yù)測(cè)市場(chǎng)走勢(shì)的機(jī)器學(xué)習(xí)模型訓(xùn)練更快,使金融機(jī)構(gòu)能夠根據(jù)近期市場(chǎng)行為調(diào)整策略,而非可能不再適用的歷史模式。用于欺詐檢測(cè)的數(shù)據(jù)分析能夠?qū)崟r(shí)處理交易,在損失累積前發(fā)現(xiàn)可疑模式。
這里的速度優(yōu)勢(shì)直接轉(zhuǎn)化為更好的結(jié)果。更快抓到欺詐能省錢(qián)。投資組合重新平衡比競(jìng)爭(zhēng)對(duì)手快15分鐘,抓住了競(jìng)爭(zhēng)對(duì)手錯(cuò)失的機(jī)會(huì)。監(jiān)控交易行為的人工智能系統(tǒng)會(huì)發(fā)現(xiàn)序列處理發(fā)現(xiàn)的異常,但為時(shí)已晚,無(wú)法及時(shí)采取行動(dòng)。
實(shí)際上運(yùn)行GPU工作負(fù)載需要的不僅僅是GPU訪問(wèn)。你需要強(qiáng)大的云基礎(chǔ)設(shè)施來(lái)支持這些GPU。高密度共置設(shè)施提供了物理基礎(chǔ):冗余電力系統(tǒng)、冷卻系統(tǒng)和網(wǎng)絡(luò)連接,以應(yīng)對(duì)這些工作負(fù)載產(chǎn)生的大量數(shù)據(jù)量。
專為計(jì)算密集型工作負(fù)載設(shè)計(jì)的共置設(shè)施帶來(lái)了可衡量的差異。電力傳輸、散熱能力、網(wǎng)絡(luò)帶寬——都需要適當(dāng)擴(kuò)展。高性能計(jì)算環(huán)境需要支持持續(xù)高負(fù)載且不降頻或硬件過(guò)熱的GPU托管基礎(chǔ)設(shè)施。
恒訊科技GPU云提供了這一基礎(chǔ),而無(wú)需在性能和成本之間做出選擇。GPU托管不應(yīng)該意味著只能選擇其中一個(gè)。看看當(dāng)今可靠的云GPU基礎(chǔ)設(shè)施能帶來(lái)什么可能性。
Copyright ? 2013-2020. All Rights Reserved. 恒訊科技 深圳市恒訊科技有限公司 粵ICP備20052954號(hào) IDC證:B1-20230800.移動(dòng)站


