AI use cases

Profile GPU execution, identify bottleneck kernels, write replacement kernels, and repeat profiling

Improve the inference engine serving GLM-5.2

From The Inference Frontier: 10x Faster Models to Self-Optimizing AI — Philip Kiely & Ali Taha, Baseten by Latent Space