Detaily Zenu 3: rozbor změn a vylepšení nové CPU architektury AMD

Minulý měsíc AMD vydalo procesory Ryzeny 5000. Jejich architektura Zen 3 přinesla nakonec možná víc, než se čekalo, výkon na 1 MHz někde převyšuje i IPC nejnovějšího jádra Intelu Willow Cove (Tiger Lake). Zen 3 je podle AMD jeho největší překopání architektury od vůbec prvního Zenu, pročež se podíváme, jaké změny v něm inženýři provedli, aby dokázali porazit Intel i v jednovláknovém a herním výkonu.

FPU: šest místo čtyř portů, také nové schedulery

Procesory AMD mají dlouhodobě vykonávání operací FPU a SIMD vyčleněné do oddělené FPU části (dost možná proto, že tyto operace pracují na odlišnou sadou registrů). Toto Intel nedělá, jeho unifikovaný scheduler zásobuje jak ALU část, tak FPU. Výhoda Intelu je asi efektivnější využití scheduleru, výhoda AMD je asi ta, že ALU a FPU operace mezi sebou nebojují o volné porty (u Intelu jsou jednotky pro ALU i SIMD/FPU operace prováděné na stejných portech).

Schéma FPU (SIMD) jednotky Zenu 2

FPU měla na rozdíl od celočíselné části u předchozích jader Zen/Zen 2 vlastní unifikovaný scheduler. Zen 3 to ovšem také mění, vypadá to, že AMD udělalo podobnou reorganizaci jako v ALU. Místo jednoho scheduleru používá FPU zdá se nyní dva, ale opět jsou separátní od ALU/AGU schedulerů.

Schéma FPU (SIMD) jednotky Zenu 3: scheduler je rozdělený na dva

AMD dál aplikovalo i ono předělání portů, takže i zde je architektura výrazně změněná. Místo čtyř portů Zenu 1/2 má Zen 3 jednotky rozdělené mezi šest portů. Přímo kapacita výpočtů, tedy kolik lze provést operací FMA za takt, kolik sčítání a násobení, se asi nezměnila. Ale protože jsou tyto jednotky rozděleny mezi více portů, lze se častěji vyhnout blokování kvůli konfliktům, kdy by program chtěl paralelně provést dvě instrukce, ale obě jsou na stejném portu, takže jedna musí počkat. Například by měly být na samostatné porty přesunuté konverze dat z floating-point dat na celočíselná a operace FPU store, aby tyto jednodušší akce neblokovaly výpočetní instrukce.

Každý ze dvou schedulerů obsluhuje tři porty. První port má jednotky zpracovávající (F)MAC a násobení, druhý port má jednotky jen sčítání a podobné jednodušší operace. Na třetím jsou ony konverze dat nebo store operace.

Schéma FPU (a také SIMD) jednotky jádra Zen 3

Nejen v tom je FPU změněná, AMD snížilo latenci operací FMAC z 5 na 4 cykly, což by mělo zlepšit výkon, když na sobě operace závisí. Toto zlepšení latencí by jinak mělo být uplatněno i u některých dalších instrukcí (přehed změn v latencích a počtu uperací proveditelných za cyklus pro tyto instrukce má v tomto článku AnandTech). V SIMD operacích byla přidána podpora pro vektorové operace (de)šifrování – VAES a VPCLMULDQ nad 256bitovými registry (AVX/AVX2), které by měly výkon těchto šifer zlepšit až dvojnásobně proti 128bitovým operacím. Ovšem jen tehdy, pokud je program použije. Zen 3 také odstraňuje pomalost operací PDEP a PEXT patřících do rozšíření BMI2. Zen 1 a Zen 2 tyto instrukce totiž prováděly mikrokódem, což bylo pomalé, kdežto Zen 3 je už zvládá s vysokým (až o dva řídy lepším) výkonem. Mimochodem: nedávno se objevily spekulace, že pomalost těchto instrukcí je důvod, proč Zen 2 nemůže podporovat Smart Access Memory. Tyto věci spolu ale nesouvisí, AMD to dementovalo.

Celkově změny ve výpočetních jednotkách (ALU i jednotky v FPU) podle měření/profilování AMD dosahují zlepšení výkonu na 1 MHz asi o 3,3 % (z celkových 19 %).


⠀

Zranitelnost karet Radeon od Sapphire: Stahujte aktualizaci BIOSu

V posledních letech se poměrně často objevují případy, kdy firmware základních desek pro PC (případně notebooků) potřebuje aktualizovat z důvodu objevu nějaké bezpečnostní zranitelnosti. Tento týden zveřejnila firma Sapphire, hlavní výrobce grafických karet Radeon, takovéto opravy pro změnu pro grafické karty s čipy RDNA. Kvůli nalezené zranitelnosti vyžadují aktualizaci všechny karty Sapphire generace Radeon RX 7000. Celý článok „Zranitelnost karet Radeon od Sapphire: Stahujte aktualizaci BIOSu“ »

Mod umožňuje používat upscaling DLSS na Radeonech RX 7000

Uvedení DLSS 5 od Nvidie spustilo vlnu projektů a modifikací od různých vývojářů, kteří tuto technologii, kterou by firma chtěla poskytovat jako exkluzivní výbavu svých nejnovějších GPU, zpřístupnily i jinde. Novinka se paradoxně ukázala být snáze „portovatelná“ než předchozí verze DLSS. Nicméně to vypadá, že hráze se protrhly hlouběji: Teď už se podařilo mimo karty Nvidie rozběhat i upscaling, a to i DLSS 4.5 se sítí typu transformer. Celý článok „Mod umožňuje používat upscaling DLSS na Radeonech RX 7000“ »

AMD RDNA 5: 2× víc AI výkonu a detaily mainstreamového GPU AT2

Před několika týdny jsme tu měli zprávu o tom, jaké frekvence lze očekávat – či jaké údajně očekává AMD – od GPU s architekturou RDNA 5, která přijdou jako nová generace po současných Radeonech RX 9000. Od stejného zdroje se teď dostaly ven další informace, včetně důležitých specifikací pro GPU „AT2“, které by se na trh mělo dostat jako první, a bude tedy první novou grafickou kartou, kterou můžeme v nejbližším roce vyhlížet. Celý článok „AMD RDNA 5: 2× víc AI výkonu a detaily mainstreamového GPU AT2“ »

Komentáre (6) Pridať komentár

  1. Zdravím, taková otázka na autora. Můžem čekat více článků od tebe na tomto webu, vzhledem k situaci s cnews. Nebo jsou nějaké jiné plány?

    1. Bez ohľadu na to, ako to dopadne so Cnews (verím, že pozitívne a čoskoro bude fungovať tak ako predtým), tak by Jano mal vo väčšom objeme vydávať články aj u nás. Celkovo sa na HWC čoskoro dočkáte veľkých zmien, na ktoré sa už pripravujeme dlhší čas a štart je blízko. 🙂

Pridaj komentár

Vaša e-mailová adresa nebude zverejnená. Vyžadované polia sú označené *