MODUS: Decoder-Only Any-to-Any Modeling of Diverse Modalities
Ranking
Overall
83
Content
90
Popularity
67
Observed public metrics from 1 member.
Merged summary
TL;DR - MODUS is a decoder-only any-to-any model that handles arbitrary modalities symmetrically as inputs and outputs. It enables flexible cross-modal generation while leveraging pretrained decoder-only models.
- Uses one network without modality-specific heads, losses, or task pipelines.
- Supports chained generation through intermediate modalities and cross-modal self-verification.
- Achieves competitive performance against specialist and multitask baselines across multiple benchmarks.
- The authors have open-sourced all materials.
Sources (1)
MODUS: Decoder-Only Any-to-Any Modeling of Diverse Modalities
Public signals
Hugging Face upvotes 18
TL;DR - MODUS is a decoder-only any-to-any model that handles arbitrary modalities symmetrically as inputs and outputs. It enables flexible cross-modal generation while leveraging pretrained decoder-only models.
- Uses one network without modality-specific heads, losses, or task pipelines.
- Supports chained generation through intermediate modalities and cross-modal self-verification.
- Achieves competitive performance against specialist and multitask baselines across multiple benchmarks.
- The authors have open-sourced all materials.