Llama 3.2 90B Vision
Llama 3.2 90B Vision is Meta's largest multimodal model in the Llama 3.2 series, combining a 90-billion parameter language backbone with vision understanding. It handles complex image analysis tasks — detailed scene description, chart and diagram interpretation, document OCR and comprehension, and visual question answering — at a quality level competitive with leading proprietary vision-language models.
Meta released it as an open-weight model, giving enterprises and researchers the ability to self-host a state-of-the-art vision-language system without API dependency. It is suited for workflows that combine image and text modalities — invoice processing, medical image captioning, technical diagram analysis, and multimodal retrieval — particularly where data cannot leave an organization's infrastructure.
Key Features
High-accuracy visual question answering over complex images
Chart, graph, and data visualization interpretation
Document OCR and layout-aware text extraction
Detailed scene and object description
Multimodal reasoning combining image and text context
Open weights for fully self-hosted multimodal deployment
Ideal Use Cases
Document intelligence and invoice processing
Medical or scientific image captioning and analysis
Technical diagram and schematic understanding
Multimodal retrieval and search augmentation
Accessibility tools generating detailed image descriptions
Example Prompts for Llama 3.2 90B Vision
Technical Specifications
| Provider | Meta |
| Category | Text |
| Modality | Text -> Text |
Frequently Asked Questions
Try Llama 3.2 90B Vision now
Start using Llama 3.2 90B Vision instantly — 100 free credits, no credit card required. Access 750+ AI models through one platform.