🛰️ Daily AI Frontier
‹ back to 2026-07-29

MODUS: Decoder-Only Any-to-Any Modeling of Diverse Modalities

arXiv cs.CV Multimodal & Generative Mingqiao Ye, Zhaochong An, Zhitong Gao, Xian Liu, François Fleuret, Chuan Li, Amir Zadeh, Serge Belongie, Afshin Dehghan, Jesse Allardice, David Mizrahi, Oğuzhan Fatih Kar, Roman Bachmann, Amir Zamir 2026-07-28
Representative image for MODUS: Decoder-Only Any-to-Any Modeling of Diverse Modalities

TL;DR - MODUS is a decoder-only any-to-any model that handles arbitrary modalities symmetrically as inputs and outputs. It enables flexible cross-modal generation while leveraging pretrained decoder-only models.

  • Uses one network without modality-specific heads, losses, or task pipelines.
  • Supports chained generation through intermediate modalities and cross-modal self-verification.
  • Achieves competitive performance against specialist and multitask baselines across multiple benchmarks.
  • The authors have open-sourced all materials.

view merged work →