LIBRISTO
LIBROAMANTO
kötelező
Legyen része a világ minden tájáról összegyűlt könyvbarátok közösségének és élvezze a rengeteg előnyt. Ingyenes regisztráció
0
Ingyenes szállítás a FoxPost futárszolgálattal, 19 990 Ft feletti vásárlás esetén
DPD gyűjtőpont 990 Ft DPD futárszolgálat 1 190 Ft GLS pont 1 190 Ft Magyar Posta 1 795 Ft PostaPont / Csomagautomata 1 690 Ft Magyar Posta 1 690 Ft FoxPost 1 190 Ft Packeta 1 190 Ft GLS futár 1 690 Ft

Ingyenes szállítás 19 990 Ft feletti rendelés esetén – Packeta, Fox Post Box és DPD csomagpont átvétellel

Inference at Full Throttle

LLM serving performance with vLLM, quantization, KV cache tuning and speculative decoding

Nyelv AngolAngol
Könyv Puha kötésű
Könyv Inference at Full Throttle ChatVariety Team
Libristo kód: 53520833
Kiadó Independently published, augusztus 2026
Master LLM Inference and Scale Your AI InfrastructureIn 2026, inference spend surpassed training spe... Teljes leírás
? points 27 b Új Új
4 037 Ft
Beszállítói készleten Küldés 14-21 napon belül

Akár 30 napos visszaküldési lehetőség

Master LLM Inference and Scale Your AI Infrastructure

In 2026, inference spend surpassed training spend across the tech industry. The engineers who can maximize tokens per second on H100, H200, and B200 GPU fleets are the most valuable specialists in AI. Inference at Full Throttle turns complex GPU performance engineering into a reproducible, highly practical discipline.

Written by the ChatVariety Team-an elite collective of ML infrastructure engineers and vLLM contributors-this book provides the exact mathematical formulas and production configurations needed to run large language models at extreme scale without breaking the bank.

What You Will Master:
  • GPU Memory Mathematics: Derive the exact KV cache formula from first principles to budget HBM memory perfectly.
  • Advanced Quantization: Deploy FP8, AWQ INT4, GPTQ, and MXFP4 based on real-world throughput and quality trade-offs.
  • Serving Stack Optimization: Fine-tune vLLM, SGLang, TensorRT-LLM, and TGI for enterprise workloads.
  • Ultra-Fast Decoding: Implement speculative decoding, EAGLE-class self-speculation, and KV cache prefix caching.
  • Distributed Scale: Combine tensor, pipeline, and expert parallelism (MoE) across multi-node GPU clusters.
  • Production Benchmarking: Avoid common traps by measuring TTFT, TPOT, and tail latency under realistic workloads.

Stop wasting millions on sub-optimal cloud GPU allocations. Learn how to design, benchmark, and operate multi-tenant, high-throughput, and ultra-low-latency LLM serving architectures today.

Színésznő & Poliglott
EWA KASP részére
A videó lejátszása
Ewa Kasp
A Libristo rendelkezik az idegennyelvű könyvek legnagyobb kínálatával. Ezért vásárolom a könyveket itt.

Információ a könyvről

Teljes megnevezés Inference at Full Throttle
Nyelv Angol
Kötés Könyv - Puha kötésű
Kiadás éve 2026
Oldalszám 82
EAN 9798192412626
Libristo kód 53520833
Súly 123
Méretek 152 x 229 x 4
Ajándékozza oda ezt a könyvet még ma
Nagyon egyszerű
1 Tegye a kosárba könyvet, és válassza ki a kiszállítás ajándékként opciót 2 Rögtön küldjük Önnek az utalványt 3 A könyv megérkezik a megajándékozott címére

Belépés

Bejelentkezés a saját fiókba. Még nincs Libristo fiókja? Hozza létre most!

 
kötelező
kötelező

Nincs fiókja? Szerezze meg a Libristo fiók kedvezményeit!

A Libristo fióknak köszönhetően mindent a felügyelete alatt tarthat.

Libristo fiók létrehozása
Libroamiko könyvtanácsadó
Szia, Libroamiko vagyok, segíthetek?