On-Premise Multimodal ML Engineer

Job ID: 39492268

Budget: $5,000 – $10,000 USD

We’re looking for an experienced ML engineer to focus on local inference and validation of multimodal AI models in sensitive offline settings. Responsibilities include:
- Running quantized or lightweight LLMs in local GPU-enabled environments.
- Using frameworks like transformers or llama.cpp with optimization on NVIDIA RTX-class GPUs.
- Designing lightweight interfaces (e.g., Flask or Streamlit) for model interaction.
- Validating output quality against internal corpora or synthetic scenarios.
- (Optional) Experience with MONAI for processing medical imaging data is a plus.