Agents That Own Their Inference — Du'an Lightfoot & Khaja Omer, Akamai Technologies
Akamai engineers turn dedicated-GPU inference into a measurable agent-workload decision, using vLLM labs to compare memory budgets, caching, FP8, speculative decoding, and concurrency tuning rather than assuming every optimization helps.