Algoritmy a jejich implementace

V letním semestru 2013/2014 přednáším o tom, jak se algoritmy implementují na reálných počítačích. Bude to přednáška na pomezí teorie a praxe. Očekávat můžete rychlokurs pokročilých partií jazyka C, stručný přehled charakteristik hardwaru důležitých pro optimalizaci algoritmů, základy paralelního programování na SMP/NUMA a zajímavou teorii s překvapivými výsledky v praxi – například cache-oblivious algoritmy.

Přednáška se koná ve středu od 15:40 v S4, cvičení ve čtvrtek od 15:40 v SU2.

Cvičení vede Láďa Láska.

Co se přednášelo

datum	téma
26. 2.	Motivace: záhada transponování matice. Úvod do hlubin jazyka C11: Typový systém a reprezentace objektů (na co se lze spolehnout a na co už ne).
27. 3.	Pokračování na prvním cvičení: Výrazy, literály a operátory. Vedlejší efekty a synchronizační body. Jak číst deklarace, kvalifikátory (const, volatile, restrict) a třídy uložení (static a spol.) Viz Medvědův průvodce po Céčku.
5. 3.	Céčko podruhé: Funkce, jejich deklarace, práce s va_listy. Příkazy. Preprocesor a pravidla nahrazování maker.
6. 3.	Pokračování na druhém cvičení: Standardní knihovna. Některá rozšíření GCC.
12. 3.	Jak číst přeložené programy. Základy assembleru na IA32/AMD64: datové typy, registry, adresní módy, volací konvence. Různé překlady téhož programu.
19. 3.	Cache a jejich hierarchie. Správa paměti, TLB a jejich interakce s cachemi. Graf rychlosti přístupů k paměti a věštění z něj. Spusťte si kreslítko grafů (viz repozitář) na svém stroji a zamyslete se nad jeho výstupem.
26. 3.	Jak procesor zpracovává instrukce. Různé implementace architektury x86. Pipelines, scheduling instrukcí a predikce skoků. (Přednášel Láďa Láska.)
2. 4.	Ještě k přístupům k paměti. Vektorové instrukce – nahlédnutí do zvěřince (MMX, SSE, AVX). Netemporální přístup k paměti a prefetche.
9. 4.	Vektorové programování v Céčku. Zmínka o AVX-512. Počítače s více procesory: SMP, protokoly MESI a MOESI pro koherenci cache. Vícejádrové procesory, HyperThreading a Bulldozer. Spusťte si na svém počítači machinfo (viz repozitář), co asi vypíše?
16. 4.	Různé topologie víceprocesorových strojů, FSB, HyperTransport, QuickPath a NumaConnect. Příklad ze života: AMD Magny-Cours a triky v jeho implementaci L3 cache. Directory-based koherence a HT-Assist.
23. 4.	Jak programovat na SMP a NUMA. Procesy a vlákna a jejich synchronizace (thread-local storage, sdílení paměti, zámky, semafory a jejich implementace). Bezzámkové techniky: atomické instrukce, transakční paměť softwarová i hardwarová. Mnoho způsobů, jak si pořídit race condition nebo deadlock.
30. 4.	Programování na NUMA. Relativita pořadí zápisů. Paměťový model C11. Příklad ze života: Jak jsme programovali sorter pro LibUCW. Interní třídící algoritmy a jejich chování. Externí třídění aneb proč disk není páska.
7. 5.	Cache-oblivious algoritmy: definice I/O modelu, cache-oblivious a cache-aware modelů. Násobení matic metodou Rozděl a panuj, "fraktální" reprezentace matic. Model kontra realita.
14. 5.	Místo přednášky se koná rektorský sportovní den.
21. 5.	Cache-oblivious algoritmy: odhad na kompetitivnost LRU, B-stromy a van Emde-Boasovo uspořádání vyhledávacích stromů. Třídění v I/O modelu a odpovídající dolní odhad (důkaz jsme nestihli, najdete ho v článku od Aggarwala a Vittera).

Zkoušky

Ke zkoušce je potřeba zápočet a znalost odpřednesené látky (bez technických detailů hardwaru). Na zkouškové termíny se prosím hlaste v SISu; po domluvě vás rád vyzkouším i jindy.

Odkazy

Repozitář s materiály k přednášce:
- Git: https://gitlab.kam.mff.cuni.cz/mj/aim.git
Různé texty k přednášce:
- Minulé ročníky: 2013, 2012, 2011, 2010, 2008.
- Programování s ohledem na hardware (architektura PC z pohledu programátora)
- Slidy o knihovně LibUCW
- Michal Vaner sepsal zápisky z roku 2008
Céčko a Unix:
- Norma jazyka C11
- Single Unix Specification (nástupce POSIXu)
- System V ABI (pro 32-bitový mód; na Linuxu berte s rezervou)
- AMD64 ABI (64-bitový mód)
- Dokumentace ke GCC
- comp.lang.c FAQ (pozor, mírně zastaralé)
- Funny C/C++ Declarations :)
- přednáška Jonase Skeppstedta o paralelním programování, v níž je mimo jiné pěkně převyprávěn paralelní paměťový model C11
Hardware:
- What Every Programmer Should Know About Memory od Ulricha Dreppera
- The Art of Assembly Language Programming od Dominique Thiebauta
- Sandpile – prakticky vše o procesorech x86/amd64
- Dokumentace od procesorů AMD (za přečtení stojí zejména AMD64 Architecture Programmer's Manual a Software Optimization Guide)
- Totéž od Intelu
- Dokumentace od GPU ATI R6xx
Optimalizační triky:
- Bit Hacks – různé triky s čísly a bitovými operacemi
- Software optimization resources Agnera Foga
Teorie:
- Cache-Oblivious Algorithms and Data Structures – úvodní text od Erika Demaine
- The I/O Complexity of Sorting and Related Problems od A. Aggarwala a J. S. Vittera