InnoText: A Unified Model for Visual Text Generation and Editing
Ranking
Overall
72
Content
85
Popularity
41
Observed public metrics from 1 member.
Merged summary
TL;DR - InnoText is a unified diffusion-transformer model for generating and editing visual text, including small-scale and Chinese characters. It aims to improve legibility and consistency while replacing separate task-specific pipelines.
- Uses one DiT-based framework for both visual text generation and editing.
- Introduces font size-aware modulation and small-character augmentation to improve fine-grained text fidelity.
- Applies a task-specific region-weighted loss for adaptive optimization.
- Provides a bilingual English-Chinese dataset spanning varied fonts, sizes, and backgrounds.
Sources (1)
InnoText: A Unified Model for Visual Text Generation and Editing
Public signals
Semantic Scholar citations 0 · Semantic Scholar influential citations 0
TL;DR - InnoText is a unified diffusion-transformer model for generating and editing visual text, including small-scale and Chinese characters. It aims to improve legibility and consistency while replacing separate task-specific pipelines.
- Uses one DiT-based framework for both visual text generation and editing.
- Introduces font size-aware modulation and small-character augmentation to improve fine-grained text fidelity.
- Applies a task-specific region-weighted loss for adaptive optimization.
- Provides a bilingual English-Chinese dataset spanning varied fonts, sizes, and backgrounds.