Skip to content
Open
Changes from all commits
Commits
File filter

Filter by extension

Filter by extension

Conversations
Failed to load comments.
Loading
Jump to
Jump to file
Failed to load files.
Loading
Diff view
Diff view
75 changes: 75 additions & 0 deletions README.es-ES.md
Original file line number Diff line number Diff line change
@@ -0,0 +1,75 @@
# UniFit: Hacia un Prueba Virtual Universal con Alineación Semántica Guiada por MLLM

<div align="center">

[![arXiv](https://img.shields.io/badge/arXiv-2511.XXXXX-b31b1b.svg)](https://arxiv.org/abs/2502.XXXXX)
[![Hugging Face](https://img.shields.io/badge/%F0%9F%A4%97%20Hugging%20Face-Models-yellow)](https://huggingface.co/zwplus/UniFit)
[![License](https://img.shields.io/badge/License-CC%20BY--NC--SA%204.0-lightgrey.svg)](./LICENSE)

</div>


## 📢 Noticias
* **[2025-11-20]** 🎉 **UniFit** ha sido aceptado en **AAAI 2026**!
* **[2025-11-20]** 🚀 Se ha creado el repositorio oficial. Publicaremos el código y los puntos de control pronto.

## 📝 Lista de Tareas Pendientes
Estamos preparando activamente el código para su publicación. ¡Manténganse atentos!

- [x] Publicar el Artículo (arXiv)
- [ ] **Publicar el Código de Inferencia**
- [x] Base Flux.1 Fill
- [ ] Base SD 3.5 Medium
- [ ] **Publicar Modelos Preentrenados (Puntos de Control)**
- [ ] UniFit (Base SD 3.5 Medium)
- [ ] UniFit (Base Flux.1 Fill)
- [ ] **Publicar Códigos de Entrenamiento**
- [ ] Scripts de procesamiento de datos
- [ ] Scripts de entrenamiento para Etapa I y II


## 💡 Resumen
La prueba virtual basada en imágenes (VTON) tiene como objetivo sintetizar imágenes fotorrealistas de una persona usando prendas específicas. A pesar de los avances significativos, construir un marco de VTON universal que pueda manejar de forma flexible tareas diversas y complejas sigue siendo un gran desafío. Los métodos recientes exploran marcos de VTON multitarea guiados por instrucciones textuales, pero aún enfrentan dos limitaciones clave: (1) la brecha semántica entre las instrucciones de texto y las imágenes de referencia, y (2) la escasez de datos en escenarios complejos. Para abordar estos desafíos, proponemos UniFit, un marco de VTON universal impulsado por un Modelo Grande de Lenguaje Multimodal (MLLM). Específicamente, introducimos un Módulo de Alineación Semántica Guiada por MLLM (MGSA), que integra entradas multimodales utilizando un MLLM y un conjunto de consultas aprendibles. Al imponer una pérdida de alineación semántica, MGSA captura las relaciones semánticas entre modalidades y proporciona una guía semántica coherente y explícita para el proceso generativo, reduciendo así la brecha semántica. Además, mediante el diseño de una estrategia de entrenamiento progresivo en dos etapas con un pipeline de autosíntesis, UniFit es capaz de aprender tareas complejas a partir de datos limitados. Experimentos extensivos demuestran que UniFit no solo admite una amplia gama de tareas de VTON, incluyendo prueba de múltiples prendas y prueba de modelo a modelo, sino que también logra un rendimiento de vanguardia.

<div align="center">
<!-- Por favor, nombren su imagen de demostración como teaser.png y colóquenla en la carpeta assets -->
<img src="assets/network.png" width="100%" alt="Red"/>
</div>

## 🔧 Instalación
Próximamente. ...
<!-- 1. **Clonar el repositorio**
```bash
git clone https://github.com/zwplus/UniFit.git
cd UniFit
``` -->

<!-- 2. **Crear un entorno virtual**
```bash
conda create -n unifit python=3.10
conda activate unifit
``` -->

<!-- 3. **Instalar dependencias**
```bash
pip install -r requirements.txt
``` -->

## ⬇️ Zoo de Modelos

Próximamente. Proporcionaremos pesos para modelos basados en SD3.5 y Flux.1.

| Modelo | Base | Descripción | Descargar |
| :--- | :--- | :--- | :--- |
| **UniFit-SD3.5** | SD 3.5 Medium | Velocidad y calidad equilibradas (Recomendado) | [Enlace]() |
| **UniFit-Flux** | Flux.1 Fill | Mayor fidelidad y adherencia al prompt | [Enlace]() |


## 🚀 Inferencia

*(Ejemplos de comandos - se actualizarán al publicar el código)*



## 🙏 Reconocimiento
Nuestro código está modificado a partir de [Diffusers](https://github.com/huggingface/diffusers). Utilizamos [Stable Diffusion 3.5 Medium](https://huggingface.co/stabilityai/stable-diffusion-3.5-medium) y [FLUX.1-Fill-dev](https://huggingface.co/black-forest-labs/FLUX.1-Fill-dev) como modelos base. Adoptamos [Qwen2-VL-2B-Instruct](https://huggingface.co/Qwen/Qwen2-VL-2B-Instruct) como el Módulo MGSA. Gracias a todos los colaboradores!