Quin és el nom del model pel nou processador Tachyum?

Les CPU Tacum Prodigy usen un disseny de processador universal que vol dir que poden executar CPU, GPU, i tasques TPU en el mateix xip, estalviar costos sobre productes competibles i també oferir un rendiment molt alt.

La companyia intenta abordar tots tres gegants xips, ADM, Intel & NVIDIA amb la seva línia de fil Prodigy i en les seves presentacions, Tyum ha estimat un rendiment 4x molt inspirador sobre les CPU Xeon de l' Intel·ligència, al front de l' HPC, un augment 3x sobre l'HVIDIA 100 i un augment de 6x en el rendiment en brut de l'AI i en la qual funciona. Les fitxes també es diuen que ofereixen més de 10x l'actuació dels sistemes dels seus competidors al mateix poder. Algunes de les característiques principals de les CPU inclouen:

Tayum ha publicat el paper blanc complet del seu processador universal Prodigy que detalla l'arquitectura de la CPU, la plataforma i la línia, que s'escalarà des de la baixa potència T8232-LP2-LP2, la CPU principal de 180W TDP, fins a la bandera T16128-AX, que inclou un total de 128 nuclis.

Dyum Prodigy Architecture universal de la CPU - Disseny personalitzat de 64 bits

L' arquitectura T Tayum Prodigy fa ús d' una OOD (Out-Of- Order) que pot descodificar i retirar-se a 8 instruccions per rellotge, escriviu a 11 instruccions per rellotge, amb una cua d' instruccions que permeten fins a 48 instruccions i un planificador que permet 12 cues que siguin de més profundes. Ve amb quatre ALUs, una unitat de càrrega, una unitat de magatzem, una unitat de càrrega/ magatzem, una unitat de màscara i dues unitats de vector 1024- bit. Cada nucli també té un subsistema IA que inclou una unitat de matriu de 4096-bit. Cada nucli és un disseny de maquinari amb una sola lectura.

Venint a la configuració de la memòria cau, cada paquet principal de 64 KB deche & 64 KB-Cheac amb SECEN ECC. Cada nucli té 1 MB de L2 amb un doble error correcte ECC i triple error detecta el DECTED. Els nuclis actius també poden fer piscina en la memòria cau L2 des dels nuclis de la CPU inactius per actuar com a un cau compartit L3.

Prodigy empra un protocol innovador de coherència, T-MESI (Tachyum-MESI), basat en MESI. T-MEI afegeix optimitzacions que milloren la tardència i l'actuació. A més de la coherdència de la memòria cau de l'chip, Prodigy també permet la coherència de maquinari entre dispositius Prodigy que permeten tant de 2ockets i 4 plataformes deocket per ser totalment coherents. Els hardwares prodigyas usen vuit carrils de doble cara d'onze2 gigabit/ssec SERDES enllaços entre cada conjunt de dispositius coherents, proporcionant un agregat de 1,8 tet/ssec de banda entre dispositius coherents.

Prodigys TLB pot tenir petjades de memòria grans per a HPC, fins a 128 TB. La MUM té maquinari gestionat per a l'actuació màxima i inclou un mecanisme de purgació global sofisticat.

Unitats vectorials i matrius

Els subsistemes de vectors Prodigyts 2x1024- bit1024 són 2x la mida de la Intel·ligència i 4x la mida dels processadors d'AMD. La unitat de matriu Prodigy 4096 dóna 16 x 16, 8 x 8, i 4 x 4 operacions. El vector i els subsistemes de matriu permeten una àmplia varietat de tipus de dades, incloent FP64, FP32, TF32, BF16, Int8, FP8, així com TAI, o Takaum AA, un nou tipus de dades que s' anuncien més tard aquest any i donarà un rendiment més alt que FP8. Les operacions de matrius prodigys permeten als tipus de dades parsecs per a un rendiment més alt, incloent 4: 2 Whandestitat que també està suportada per la Nvidia H100, així com Tyum símps Super-sparitat, cosa que permet fins i tot un rendiment superior amb una relació de 8: 3.

Tipus de dades parsecs maximitza el rendiment per a l' entrenament i la inferència amb una reducció molt menor en l' exactitud. Els tipus de dades de baix precisió i la imperpersió es discuteixen en més detall a la secció 2001-2005Prodigy a la vora de la vora de l'AI IPINIA. Operacions d' expansió/Gather proporcionen ràpid, càrrega eficient i desat per a vectors i matrius.

Sistemes de memòria i E/ S

Prodigy integra un controlador de memòria de l'industria líder de setze DDR5 que s'executen a DDR5-7200, proporcionant aproximadament 1 TB/ssec de banda de memòria, donant suport a 2 DIMMs per canal. Aquest any s'anuncia una nova característica anomenada widthB i width Amplification=10, que es doblarà efectivament l'ample de memòria per a una sorprenent 2 TB/ssec. El subsistema PCIe inclou 64 carrils de PCIe 5. 0 amb 32 controladors PCIe.

El subsistema PCIe inclou 4 x16 Blocs funcionals PCIe, i cadascun dels x16 blocs inclou 8 controladors que poden multiplicar fins a x2, oferir una flexibilitat màxima per implementar dispositius externs des de l' alt rendiment NICs a grans matrius d'emmagatzematge NVMe.

Emulació per x86, Braç, RISC-V Prodigy Runds

Prodigy accepta la traducció del programari dinàmica d' altres arquitectures establertes (ISA) que inclouen x86, Arma i RISC- V. x86 és el processador de centre de dades establert, l' Braç és molt predominant per a aplicacions telco, i RISC-V és popular amb institucions acadèmiques. El més alt per a la traducció binària és aproximadament 30 - 40%, però el Prodigy s' executarà aproximadament dues vegades la freqüència dels processadors competitius, de manera que l'actuació hauria de ser similar a executar el nadiu. La traducció binària està destinada a habilitar ràpidament, fàcil fora de l'avaluació de la caixa i la comprovació dels clients i socis, amb els clients que van cap a ProdigySettingss natius ISA per als desplegaments de producció per al màxim rendiment.

Totes les fitxes són fabricades en el 5nm de TSMC (N5P) node de procés que és una variant lleugerament optimitzada del node estàndard 5nm (N5) i s' executen natiu i x86, Arma i SISC-V. Pel que fa a les característiques específiques d' HPC i IA, la línia de fil Tacy Prodigy inclou:

Tots els 128 nuclis de la CPU flagstata són rellotgeats a 5. 7 GHz +, els clients de l'AI pujaran a 16 canals de memòria, donant suport a 32 TB (64 DIMM) de DDR5-7-200. El processador també rockà 64 PCIe Gen 5.0 carrils i arribarà en un paquet 950W TDP.

La resta de CPU que ofereix Tachyum es llistaran en el full d' especificacions de sota:

Això és només un xip i un ordinador Tachyum permetrà tota la competència del maquinari que dóna suport a 2 i 4 sistemes d'esports. Això depèn de 512 nuclis i 3600W d'energia de 4 Progidy T16128-AIX.

La plataforma Prodigy vindrà en diverses solucions de grador, com ara un servidor de 2U, que serà capaç d'anar a casa fins a 4 xips de Tachyum Prodigy, 64 GB DDR5 DIMM, i 2x200 GE RoCE NIC. També hi ha un disseny personalitzat de referència 48Urries que ve en dues versions, un líquid es va refredar i un dels aires aeris. La versió d'aire ben neta dóna 40 4 servidors de 2U per a un total de 160 xips mentre que la versió de líquid dóna suport a 88 4 màquines 1U per a un total de 352 xips. Els dos pits tenen un disseny modular i dos crons es poden combinar en un gabinet de 2 punts per optimitzar l'espai de terra. Cada servidor ve amb quatre sòcols cLGA.

La Tayum també proporciona algunes estimacions preliminars contra el Lake Intel Ice Lake, NVIDIA Hopper / Grace HPC xips i CPU AD Milà. L'empresa afirma que un programa de coma flotant de 4x SPE entre els 2017 i 30x Rawous (F64) augmenta amb la competència. Hopper H100 de NVIDIA és el xip principal que sembla que Tayum té els seus ulls establerts com s'utilitza en diverses proves comparades.

Algunes de les figures de rendiment mencionades inclouen:

  • 3x contra el rendiment de NVIDIA H100 en doble precisió flotant de Punta
  • 6x contra el rendiment de NVIDIA H100 a IAF8
  • 9x contra NVIDIA H100 en funció de rendiment per Wat
  • 4x contra Intel Xeon Platinum 8380 en espectació de 2017 INT
  • 30x contra Intel Xeon Platinum 8380 en el rendiment de FP64

La Tayum també proporciona algunes estimacions preliminars contra el Lake Intel Ice Lake, NVIDIA Hopper / Grace HPC xips i CPU AD Milà. L'empresa afirma que un programa de coma flotant de 4x SPE entre els 2017 i 30x Rawous (F64) augmenta amb la competència. Hopper H100 de NVIDIA és el xip principal que sembla que Tayum té els seus ulls establerts com s'utilitza en diverses proves comparades.

Mentre que el Prodigy T16128-AIX ofereix al voltant de 90 TFLOPs de FP64 perf (amb rneralitat). L'empresa utilitza una llista de Prodigy airada de Prodigy que s'estima que s'entrega a 6.2 PetaFlops del cavall HPC FP64 amb una gestió de l'HVIDIA100 DGX PODL, que ofereix 960 TFLOPs de l'actuació FP64C. El prodigi líquid que pot sostenir patates més altes hauria de donar doble rendiment a les 12.9 PetaFLOP.

La Tahum espera que els primers vaixells de Prodigy comencin a remarcar més tard aquest any amb producció de volum esperaten en la segona meitat de 2023. La següent actualització delgen a Prodigy, coneguda com a Prodigy 2 es llista al mapa de carreteres Tyum i oferirà una nova arquitectura 3nm amb més nuclis, major banda de memòria, PCIe 6. 0 + CXL, i millorarà la connectivitat. Samplling on ha de començar per la segona meitat de 2024.

Seccions
Empresa

Artículos Relacionados:

- Processador -

Esta web usa cookies, puedes ver la política de cookies, aquí -
Política de cookies +