Inilabas ng Huawei noong Huwebes ang isang AI computing system na nag-uugnay sa hanggang 4,096 na processor, na inaangkin na may 8 exaflops na may mababang precision performance at hanggang isang petabyte ng high-bandwidth memory. Ang Atlas 960E SuperPoD ang pinakabagong pagtatangka ng kumpanya na tumbasan ang limitadong access ng China sa mga pinaka-advanced na kagamitan sa paggawa ng chip sa pamamagitan ng pagpapabuti kung paano nagtutulungan ang maraming bilang ng mga processor na gawa sa loob ng bansa.
Ipinakilala ang sistema sa Huawei Connect sa Shanghai bilang bahagi ng mas malawak na roadmap ng hardware na magpapabilis sa Ascend 960 chip hanggang sa unang bahagi ng 2027. Ang mga bilang ng performance, power, at reliability ng Huawei ay hindi pa nabeberipika nang nakapag-iisa, at nahaharap pa rin ang kumpanya sa mga limitasyon sa produksyon at software. Gayunpaman, ipinapakita ng anunsyo na ang pakikipagkumpitensya sa Nvidia ay lumalampas na sa mga indibidwal na chip patungo sa kumpletong mga sistema ng computing.
Ang mga optical link ang naging pangunahing taya sa central engineering
Mahigpit na nagkokonekta ang isang SuperPoD sa maraming computing node upang makapagpalitan sila ng data at gumana na parang iisang makina. Sinabi ng Huawei na ang Atlas 960E nito ay gumagamit ng near-packaged optics, o NPO, upang maglipat ng data sa mga processor na may mas kaunting electrical loss kaysa sa mga conventional connection. Sinasabi sa teknikal na pahayag na 5,500 Hi-ONE optical units ang papalit sa kung ano ang mangangailangan sana ng 48,000 800-gigabit optical modules.
Inaangkin ng Huawei na ang disenyo ay nakakabawas sa konsumo ng kuryente ng mahigit 550 kilowatts habang nagbibigay ng 99.8% na availability ng sistema. Inilalarawan ng mga numerong iyon ang nilalayong configuration ng kumpanya, hindi ang na-audit na resulta ng operasyon mula sa isang independiyenteng customer. Gayunpaman, tinutukoy nila ang bottleneck na inaatake ng Huawei: habang lumalaki ang mga AI cluster, ang komunikasyon sa pagitan ng mga processor ay maaaring kumonsumo ng tumataas na dami ng enerhiya at oras, na naglilimita sa kung gaano karaming teoretikal na computing power ang nakakagawa ng kapaki-pakinabang na trabaho.
Ang sistemang iskala ang sagot ng Huawei sa mga limitasyon sa pagmamanupaktura
Ang mga paghihigpit sa pag-export na pinangungunahan ng US ay naglimita sa pag-access ng mga Tsino sa mga pinakamahuhusay na accelerator ng Nvidia at sa mga advanced na kagamitan sa paggawa ng semiconductor. Nangunguna ang Huawei sa domestic AI-infrastructure market ng Tsina, ngunit kinilala ng rotating chairman na si Eric Xu na ang kumpanya ay hindi makakagawa ng sapat na kagamitan upang matugunan ang demand, ayon sa Reuters. Ang kakulangang iyon ay ginagawang mahalaga ang performance ng bawat processor, ngunit pinapataas din nito ang halaga ng arkitektura na maaaring makakuha ng mas maraming output mula sa mga available na chips.
Hindi hinihiling ng estratehiyang Atlas na itugma ng bawat processor ng Ascend ang pinakabagong chip ng Nvidia nang paisa-isa. Sa halip, sinusubukan ng Huawei na pagsamahin ang libu-libong processor sa pamamagitan ng UnifiedBus interconnect nito at i-scale ang maraming SuperPoD sa mas malalaking cluster. pahina ng kumperensya ang isang sistemang may kakayahang umabot sa isang milyong neural processing unit, bagama't isa itong target na arkitektura sa halip na ebidensya na gumagana na ngayon ang instalasyon ng isang milyong processor.
Ang isang mas mabilis na roadmap ng chip ay nagpapataas ng presyon ng kompetisyon
Inilipat din ng Huawei ang Ascend 960DT training chip sa unang quarter ng 2027, kung saan inaasahan ang isang inference-focused na 960PR sa ikatlong quarter. Sinabi ng isang tagapagsalita ng kumpanya sa TechCrunch na dodoblehin ng henerasyong 960 ang performance. Ang Ascend 970 at 980 chips ay nakaplano para sa 2028 at 2029, na magpapalawak sa cadence bilang isang taunang hamon sa product cycle ng Nvidia.
Mahalaga ang tiyempo dahil ipinakilala ng Huawei ang Atlas 960E ilang buwan lamang matapos ipakita ang Atlas 950 system nito. Iniulat ng Associated Press na ang mabilis na pag-upgrade ay nagbibigay-diin sa pagsusulong ng Tsina para sa teknolohikal na pag-asa sa sarili at nangyayari habang ang mga Chinese AI developer ay lalong gumagamit ng mga domestic hardware. Gayunpaman, sinasabi pa rin ng mga analyst na ang advanced na pagsasanay sa modelo ng Tsina ay kadalasang umaasa sa mga chips ng US, na nagpapahirap sa transisyon.
Ang software ay nananatiling isang mas mahirap na balakid kaysa sa bilang ng mga rack
Hindi lamang bilis ng processor ang bentahe ng Nvidia. Ang CUDA software platform, mga tool ng developer, at mga library nito ay naipon sa loob ng maraming taon, na ginagawang mas madali para sa mga research team na magpatakbo ng mga modelo at mag-diagnose ng mga pagkabigo. Pinalalawak ng Huawei ang CANN software stack nito, sinasabing sinusuportahan ang Ascend bilang isang PyTorch accelerator backend at iniulat na mahigit 90 kilalang open-source na proyekto ang gumagana na ngayon gamit ang platform.
Ipinapakita ng mga independiyenteng ebidensya kung bakit mahalaga ang gawaing ecosystem na iyon. Isang pag-aaral sa larangan ng dalawang malalaking modelo ng workload sa isang 16-device na Ascend 910 system ang nangailangan ng 12 source-code patch, ang pag-disable ng ilang high-throughput features, at mga bagong pananggalang laban sa mga paulit-ulit na pagkabigo ng device. Ipinakita ng preprint na ang mga workload ay maaaring tumakbo nang tama, ngunit naidokumento rin nito ang hindi pa ganap na suporta sa operator, marupok na parallelism, limitadong obserbasyon, at mga gastos sa engineering na hindi nakukuha ng mga hilaw na detalye ng pagganap.
Maaaring mapabuti ng Atlas 960E ang pagiging maaasahan ng hardware at komunikasyon nang hindi agad nalulutas ang mga problemang software na iyon. Pinapalaki ng malalaking sistema ang mga bunga ng mahinang mga tool sa pag-debug, mga hindi tugmang operator, at mga depekto na nakakaantala sa pagsasanay. Samakatuwid, ang pag-aampon ay depende sa kung magagawa ng Huawei na produktibo ang platform para sa mga developer, hindi lamang kung makakakonekta ito ng mas maraming processor.
Pinakikitid ng bagong sistema ang isang puwang at inilalantad ang isa pa
Ang anunsyo ng Huawei ay nagtatatag ng isang malinaw na teknikal na direksyon: gumamit ng mga optical interconnect, malalaking kumpol, at mas mabilis na mga siklo ng produkto upang mabawasan ang kawalan na dulot ng mga paghihigpit sa pagmamanupaktura. Hindi ito katumbas ng Nvidia, dahil ang mga nabanggit na benchmark ay mga pahayag lamang ng vendor at ang kapaligiran ng software ay nananatiling hindi pa ganap ang pag-unlad. Hindi rin nito itinatatag kung gaano karaming mga sistemang Atlas 960E ang maaaring itayo ng Huawei habang ang demand ay lumalampas na sa supply.
Ang susunod na makabuluhang ebidensya ay magmumula sa mga kargamento sa dami, pag-deploy ng customer, at mga resulta ng pagsasanay at paghihinuha na maaaring kopyahin nang nakapag-iisa pagkatapos dumating ang Ascend 960. Hanggang sa panahong iyon, ang 4,096-processor na SuperPoD ay pinakamahusay na mauunawaan bilang isang kapani-paniwalang tugon sa antas ng sistema sa mga limitasyon ng chip ng China, hindi patunay na nawala na ang mga limitasyong iyon.