New opportunity

AI Model Optimization Architect

Qualcomm Technologies, Inc. · Austin, United States of America

About this role

Qualcomm is seeking a Staff Engineer – AI Model Optimization Architect to lead end-to-end model transformation and optimization for LLMs, VLMs, diffusion, and multimodal models on Qualcomm inference accelerators, partnering with compiler, performance, and accuracy teams. Responsibilities include driving graph capture and deployment, designing and implementing fusion kernels, profiling and optimizing inference, and architecting distributed inference and continuous batching strategies.

Skills for this role

PyTorchONNXtorch.compileTorchDynamoPythonGraph captureGraph-level transformationsFusion kernelsTritonDSLsKernel fusionML compilersTransformer architecturesAttention mechanismsMoEsKVcache managementDecoding optimizationsLong-context performanceContinuous batchingLLM serving stacksLLMsVLMsDiffusion modelsMultimodal modelsProfilingPerformance optimizationServing time optimizationsMemory/performance tradeoffsComputer architectureML accelerators''Distributed systems''Distributed inference''Sharding''Data/