The technique that enables LLMs to reason about visual inputs by combining vision and language models is called ________ Learning.
- Edge
- Federated
- Multimodal
- Reinforcement
Answer: Multimodal
Multimodal models (CLIP, LLaVA) process text, images, audio jointly, enabling visual question answering, image captioning, and cross-modal retrieval.