About this role
Qualcomm is seeking a Staff Engineer – AI Model Optimization Architect to lead end-to-end model transformation and optimization for LLMs, VLMs, diffusion, and multimodal models on Qualcomm inference accelerators, partnering with compiler, performance, and accuracy teams. Responsibilities include driving graph capture and deployment, designing and implementing fusion kernels, profiling and optimizing inference, and architecting distributed inference and continuous batching strategies.
Skills for this role
PyTorchONNXtorch.compileTorchDynamoPythonGraph captureGraph-level transformationsFusion kernelsTritonDSLsKernel fusionML compilersTransformer architecturesAttention mechanismsMoEsKVcache managementDecoding optimizationsLong-context performanceContinuous batchingLLM serving stacksLLMsVLMsDiffusion modelsMultimodal modelsProfilingPerformance optimizationServing time optimizationsMemory/performance tradeoffsComputer architectureML accelerators''Distributed systems''Distributed inference''Sharding''Data/