Model Sizes
Gemma-3 vision is available in three parameter sizes:4B Parameters
Lightweight model for resource-constrained environments
12B Parameters
Balanced model for production deployments
27B Parameters
Largest model for maximum performance
Features
- Multi-image support: Process multiple images simultaneously
- High-quality vision encoding: Advanced image understanding capabilities
- Flexible precision: Support for FP32, FP16, and BF16
- Efficient architecture: Optimized for both quality and performance
- Open source: Fully open-source with commercial license
Prerequisites
Gemma-3 vision requires nightly versions of ONNX Runtime and specific dependency versions.
Install Dependencies
1
Install ONNX Runtime GenAI Nightly
- CUDA
- DirectML
- CPU
2
Install PyTorch and Dependencies
Building Gemma-3 Vision Models
1
Download Base Model
Choose your desired model size and download from Hugging Face:
2
Download Modified ONNX Files
3
Replace Modeling Files
Replace the original files with ONNX-compatible versions:
4
Build ONNX Models
Build INT4 quantized models for optimal performance:
- CPU
- CUDA (FP16)
- CUDA (BF16)
- DirectML
5
Add Configuration Files
Download the required configuration files based on your model size:
- For 4B: genai_config.json and processor_config.json
- Modify the paths if you used different output directories
Using Gemma-3 Vision Models
Basic Image Understanding
Multi-Image Analysis
Gemma-3 vision can analyze multiple images simultaneously:Interactive Chat with Vision
Advanced Usage
Batch Processing
Process multiple image-text pairs efficiently:Structured Output
Generate structured responses (e.g., JSON):Performance Optimization
Model Size Selection
Choose the right model size for your use case:- 4B - Lightweight
- 12B - Balanced
- 27B - Maximum Quality
Best for:
- Edge devices
- Real-time applications
- Resource-constrained environments
- Quick prototyping
- Fastest inference
- Lowest memory usage (~8GB GPU)
- Good quality for most tasks
Precision Comparison
INT4 quantization is applied automatically during the build process and offers the best trade-off between speed, memory, and quality.
Execution Provider Tips
CUDA Optimization
CUDA Optimization
DirectML Optimization
DirectML Optimization
CPU Optimization
CPU Optimization
Example Application: Image Captioning Service
Troubleshooting
Model Size Selection
Model Size Selection
If unsure which model size to use:
Configuration File Errors
Configuration File Errors
Ensure configuration files match your model size:
Dependency Version Conflicts
Dependency Version Conflicts
Next Steps
Phi Vision Models
Explore Microsoft’s Phi vision models
Qwen Vision Models
Learn about Qwen’s advanced capabilities
Deployment Guide
Deploy models to production
API Reference
Explore the full API documentation