AINews Portal

AI Glossary

What is Multimodal?

A multimodal model accepts or produces multiple kinds of data: reading screenshots and PDFs, hearing audio, generating images or video. Frontier chat models are now multimodal on input by default; generation across modalities is typically handled by specialized models (image and video generators).

← All terms