LAS VEGAS — Pinalalawak ng Google ang custom data-center silicon strategy nito na higit pa sa mga artificial-intelligence accelerators, inilulunsad ang una nitong internally designed Arm-based central processing unit para sa general-purpose cloud computing. Ang bagong chip, na tinatawag na Axion, ay ipinakilala noong Martes sa Google Cloud Next habang hangad ng kumpanya na mabawasan ang pagdepende sa mga conventional x86 processor at mapabuti ang performance at energy efficiency para sa mga workload na tumatakbo sa cloud nito. Sinasabi ng Google na ang mga Axion instances ay maghahatid ng hanggang 30% na mas mahusay na performance kaysa sa pinakamabilis na general-purpose Arm-based cloud instances na available ngayon at hanggang 50% na mas mahusay na performance na may hanggang 60% na mas mahusay na energy efficiency kaysa sa maihahambing na kasalukuyang henerasyon ng x86 instances. Sinasabi ng anunsyo ng kumpanya sa Axion na ang mga processor ay binuo sa Neoverse V2 architecture ng Arm at susuporta sa mga serbisyo kabilang ang Google Compute Engine, Google Kubernetes Engine at Dataproc.
Ang hakbang na ito ay mas direktang inilalagay ang Google sa tabi ng Amazon Web Services, na gumugol ng mga taon sa pagpapalawak ng mga Graviton Arm processor nito, at ng Microsoft, na nag-anunsyo ng sarili nitong Cobalt CPU noong 2023. ng Reuters na ang paglulunsad ng Google ay sumasalamin sa mas malawak na pagsisikap ng pinakamalalaking cloud provider na magdisenyo ng mga chip na iniayon sa kanilang sariling imprastraktura, na nagpapabuti sa ekonomiya habang binabawasan ang pag-asa sa isang maliit na bilang ng mga merchant semiconductor supplier.
Ang mga pasadyang CPU ay lumilipat mula sa niche na opsyon patungo sa cloud strategy
Sa loob ng mga dekada, ang general-purpose server computing ay pinangungunahan ng mga x86 processor mula sa Intel at AMD. Ang mga disenyo ng Arm ay unang lumakas sa mga mobile device dahil sa kanilang kahusayan sa kuryente at lalong lumipat sa mga data center. Ang mga cloud provider ay nasa magandang posisyon upang mapabilis ang pagbabagong iyon dahil kinokontrol nila ang parehong hardware fleet at ang software layer na inihaharap sa mga customer. Hindi kailangang bumili ng pisikal na Arm server ang isang cloud customer; maaari itong pumili ng uri ng instance at hayaan ang provider na pamahalaan ang pinagbabatayan na makina.
Ayon sa Google, patatakbuhin ng Axion ang mga workload na ginagamit na sa loob ng kumpanya ng mga serbisyo tulad ng YouTube advertising, BigTable at mga bahagi ng Google Earth Engine. Plano ng kumpanya na magkaroon ng mas malawak na availability ng customer sa huling bahagi ng taong ito. Ang update nito sa imprastraktura sa Next 2024 ay nagpoposisyon sa Axion bilang bahagi ng mas malaking pagsisikap na bigyan ang mga customer ng mas maraming pagpipilian sa processor para sa mga web service, containerized application, database at data analytics.
Binabago ng demand ng AI ang buong stack ng data-center
Dumating ang Axion kasabay ng mga pangunahing karagdagan sa imprastraktura ng AI ng Google. Sinabi ng Google Cloud na ang TPU v5p, ang pinakamalakas nitong henerasyon ng Tensor Processing Unit, ay karaniwang makukuha. Ang isang TPU v5p pod ay maaaring umabot sa 8,960 chips at nag-aalok ng higit sa doble ng floating-point operations at tatlong beses ng high-bandwidth memory bawat chip kumpara sa TPU v4, ayon sa AI Hypercomputer update. Isinasama rin ng kumpanya ang mga Nvidia GPU sa parehong mas malawak na arkitektura, na sumasalamin sa demand ng customer para sa parehong proprietary accelerators ng Google at industry-standard na Nvidia hardware.
Unang idinetalye ng Google ang TPU v5p sa isang anunsyo, kung saan iniharap ang chip bilang imprastraktura para sa pagsasanay ng napakalaking generative models. Mahalaga ang milestone na ito para sa pangkalahatang availability dahil nagmamadali ang mga cloud provider na masiguro ang sapat na kapasidad sa computing para sa mga customer na ang mga AI workload ay nangangailangan ng libu-libong accelerators na tumatakbo nang sabay-sabay.
Mas lumalalim ang Gemini sa mga serbisyo ng enterprise cloud
Ginamit din ng Google ang kumperensya upang mas palalimin ang paggamit ng mga modelo ng Gemini nito sa Vertex AI, ang pinamamahalaang platform ng machine-learning nito. Papasok na sa pampublikong preview ang Gemini 1.5 Pro na may context window na hanggang 1 milyong token, na nagbibigay-daan sa modelo na iproseso ang hindi pangkaraniwang malalaking katawan ng teksto, video, audio, at code sa isang kahilingan lamang. sa update ng produkto ng AI ang mga bagong kakayahan sa pagbuo ng imahe, mga tool sa pamamahala ng modelo, at mga kontrol ng enterprise.
Ang 1-milyong-token context window ay estratehikong mahalaga dahil ang mga enterprise AI application ay kadalasang kailangang mangatwiran sa mahahabang dokumento, software repository, call transcript o multimedia archive. Ang mas malaking konteksto ay hindi garantiya ng mas mahusay na pangangatwiran, ngunit binabawasan nito ang pangangailangang hatiin ang impormasyon sa maraming mas maliliit na hakbang sa pagkuha. Ipinoposisyon ng Google ang kakayahang iyon bilang isang pagkakaiba laban sa mga karibal na modelo mula sa OpenAI, Anthropic at iba pa.
Ang isang patayong integrated na cloud ay maaaring mag-optimize ng gastos at pagganap
Ang estratehiya ng Google ay lalong nagmumukhang isang layered computing stack na kinokontrol nito mula sa chip hanggang sa modelo. Ang Axion ang humahawak ng general-purpose compute, ang mga TPU ay nagpapabilis ng machine learning, ang mga Nvidia GPU ay nananatiling available para sa compatibility, at ang Gemini ang nagsusuplay ng mga pangunahing modelo ng AI ng kumpanya. keynote summary ng Google Cloud na Next ang mga piyesang iyon bilang isang platform sa halip na magkakahiwalay na produkto.
Diretso lang ang lohikang pang-ekonomiya. Ang mga kompanya ng cloud ay nagpapatakbo ng napakalaking data center, kaya kahit ang mga maliit na pagpapabuti sa performance per watt ay maaaring magresulta sa malaking pagtitipid sa kuryente, pagpapalamig, at mga gastos sa kagamitan. Ang mga proprietary chip ay nagbibigay din sa mga provider ng kalamangan sa pagkuha at nagpapahintulot sa hardware na i-tune para sa kanilang software. Ang kapalit ay ang ecosystem compatibility: ang mga customer ay may mga dekada ng software na na-optimize para sa x86, at ang paglipat ng mga workload sa Arm ay maaaring mangailangan ng pagsubok o muling pag-compile.
Ang karera ng chip ay nagiging isang karera sa cloud-platform
Ipinapakita ng Graviton ng Amazon, Cobalt ng Microsoft at Axion ng Google na ang disenyo ng CPU ay nagiging bahagi na ng kompetisyon sa cloud. Kasabay nito, hinahamon ng AWS Trainium at Inferentia, ng mga TPU ng Google at ng Maia accelerator ng Microsoft ang palagay na ang Nvidia o mga tradisyunal na vendor ng CPU ang magsusuplay ng bawat mahalagang chip sa mga data center sa hinaharap. Wala sa mga proprietary processor na iyon ang nag-aalis ng pangangailangan para sa mga panlabas na supplier, ngunit ang bawat isa ay nagbibigay sa may-ari ng cloud nito ng isa pang paraan upang kontrolin ang gastos, kapasidad at pagkakaiba-iba ng produkto.
Para sa mga customer, ang agarang bunga ay mas maraming pagpipilian kasama ng mas maraming komplikasyon. Maaaring i-optimize ng mga kumpanya ang mga workload sa x86, Arm, GPU at mga espesyalisadong accelerator, ngunit ang mga desisyon sa arkitektura ay lalong nakakaapekto sa portability sa pagitan ng mga cloud. Ang isang workload na nakatutok sa isang proprietary accelerator ay maaaring mas mura o mas mabilis sa isang platform habang nagiging mas mahirap ilipat sa ibang lugar.
Hanggang Sabado, nilalapitan pa rin ng Axion ang malawakang availability ng mga customer sa halip na palitan ang mga establisadong server processor sa isang iglap. Ngunit ang anunsyo ng Google ay nagmamarka ng isang pagbabago sa istruktura: ang pinakamalaking cloud provider sa mundo ay lalong tinitingnan ang disenyo ng semiconductor bilang isang pangunahing kakayahan sa software-platform. Sa panahon ng AI, ang kompetisyon ay hindi na lamang tungkol sa kung kaninong modelo ang pinakamahusay o kung kaninong cloud ang may pinakamaraming serbisyo. Ito ay tungkol din sa kung sino ang makakabuo ng pinakaepektibong computing stack sa ilalim nila.