Resumen del rol

Software Engineer- GPU Kernels

Requisitos y responsabilidades

Contenido del rol extraído en secciones para revisar más rápido.

Details

  • Baseten Embeddings Inference: The fastest embeddings solution available
  • The Baseten Inference Stack
  • Driving model performance optimization
  • Design and implement high-performance GPU kernels for key ML operations, including matrix multiplications, attention mechanisms, and mixture-of-experts routing
  • Write and optimize code using CUDA, PTX assembly, and architecture-specific techniques
  • Apply advanced performance optimization methods such as memory coalescing, warp-level programming, tensor core acceleration, and compute/memory overlap
  • Implement cutting-edge features like quantization (FP8/FP4), sparsity, and compute/communication overlap
  • Identify and resolve performance bottlenecks using tools like Nsight Systems, Nsight Compute, and Torch Profiler
  • Collaborate with research teams to productionize theoretical advancements
  • Contribute to internal and open-source GPU libraries
  • Present technical contributions at industry conferences (e.g., NVIDIA GTC, AWS re:Invent)
  • Strong understanding of GPU architecture and programming paradigms:Memory hierarchy (global, shared, registers, L1/L2 cache)Thread/block/grid organizationSynchronization techniques and race condition mitigation
  • Memory hierarchy (global, shared, registers, L1/L2 cache)
  • Thread/block/grid organization
  • Synchronization techniques and race condition mitigation
  • Proficient in C++ and GPU performance profiling tools
  • Knowledge of:CUDA C++ APIMemory access patterns and bandwidth optimizationNumerical precision and quantization strategiesModern GPU features (e.g., tensor cores, async operations)
  • CUDA C++ API
  • Memory access patterns and bandwidth optimization
  • Numerical precision and quantization strategies
  • Modern GPU features (e.g., tensor cores, async operations)
  • Memory hierarchy (global, shared, registers, L1/L2 cache)
  • Thread/block/grid organization
  • Synchronization techniques and race condition mitigation
  • CUDA C++ API
  • Memory access patterns and bandwidth optimization
  • Numerical precision and quantization strategies
  • Modern GPU features (e.g., tensor cores, async operations)
  • Experience with Transformer models and attention optimization (e.g., Flash Attention)
  • Familiarity with GPU kernel libraries: Cutlass, Triton, Thrust, CUB
  • Background in GEMM tuning and distributed/multi-GPU compute
  • Contributions to open-source GPU projects
  • Research publications or conference presentations on GPU performance
  • Competitive compensation, including meaningful equity.
  • 100% coverage of medical, dental, and vision insurance for employee and dependents
  • Flexible PTO policy including company wide Winter Break (our offices are closed from Christmas Eve to New Year's Day!)
  • Paid parental leave
  • Fertility and family-building stipend through Carrot
  • Company-facilitated 401(k)
  • Exposure to a variety of ML startups, offering unparalleled learning and networking opportunities.
Roles similares

Mantén una lista de respaldo.

Ver stack
FocoKernelsÁrea del rol
Señal de seniorityNivel abiertoNivel del candidato
StackAWS, SparkSkills principales
Ubicación2 países aceptadosElegibilidad

Stack

Usa estas tags para comparar roles remotos similares.

Elegibilidad de ubicación

Candidatos deberían aplicar solo cuando el país del perfil aparece aquí.

Tu perfilPaís no definidoInicia sesión para comparar tu país con este rol.

Flujo de contratación

WithMira muestra el rol y luego envía candidatos a la aplicación de la empresa.

1Revisa fit del rol, stack y elegibilidad de ubicación en WithMira.
2Abre la página de aplicación de la empresa desde el link rastreado.
3Guarda el rol o suscríbete a oportunidades similares antes de salir.