diff --git a/README.es-ES.md b/README.es-ES.md
new file mode 100644
index 0000000..85a429a
--- /dev/null
+++ b/README.es-ES.md
@@ -0,0 +1,75 @@
+# UniFit: Hacia un Prueba Virtual Universal con Alineación Semántica Guiada por MLLM
+
+
+
+[](https://arxiv.org/abs/2502.XXXXX)
+[](https://huggingface.co/zwplus/UniFit)
+[](./LICENSE)
+
+
+
+
+## 📢 Noticias
+* **[2025-11-20]** 🎉 **UniFit** ha sido aceptado en **AAAI 2026**!
+* **[2025-11-20]** 🚀 Se ha creado el repositorio oficial. Publicaremos el código y los puntos de control pronto.
+
+## 📝 Lista de Tareas Pendientes
+Estamos preparando activamente el código para su publicación. ¡Manténganse atentos!
+
+- [x] Publicar el Artículo (arXiv)
+- [ ] **Publicar el Código de Inferencia**
+ - [x] Base Flux.1 Fill
+ - [ ] Base SD 3.5 Medium
+- [ ] **Publicar Modelos Preentrenados (Puntos de Control)**
+ - [ ] UniFit (Base SD 3.5 Medium)
+ - [ ] UniFit (Base Flux.1 Fill)
+- [ ] **Publicar Códigos de Entrenamiento**
+ - [ ] Scripts de procesamiento de datos
+ - [ ] Scripts de entrenamiento para Etapa I y II
+
+
+## 💡 Resumen
+La prueba virtual basada en imágenes (VTON) tiene como objetivo sintetizar imágenes fotorrealistas de una persona usando prendas específicas. A pesar de los avances significativos, construir un marco de VTON universal que pueda manejar de forma flexible tareas diversas y complejas sigue siendo un gran desafío. Los métodos recientes exploran marcos de VTON multitarea guiados por instrucciones textuales, pero aún enfrentan dos limitaciones clave: (1) la brecha semántica entre las instrucciones de texto y las imágenes de referencia, y (2) la escasez de datos en escenarios complejos. Para abordar estos desafíos, proponemos UniFit, un marco de VTON universal impulsado por un Modelo Grande de Lenguaje Multimodal (MLLM). Específicamente, introducimos un Módulo de Alineación Semántica Guiada por MLLM (MGSA), que integra entradas multimodales utilizando un MLLM y un conjunto de consultas aprendibles. Al imponer una pérdida de alineación semántica, MGSA captura las relaciones semánticas entre modalidades y proporciona una guía semántica coherente y explícita para el proceso generativo, reduciendo así la brecha semántica. Además, mediante el diseño de una estrategia de entrenamiento progresivo en dos etapas con un pipeline de autosíntesis, UniFit es capaz de aprender tareas complejas a partir de datos limitados. Experimentos extensivos demuestran que UniFit no solo admite una amplia gama de tareas de VTON, incluyendo prueba de múltiples prendas y prueba de modelo a modelo, sino que también logra un rendimiento de vanguardia.
+
+
+
+

+
+
+## 🔧 Instalación
+Próximamente. ...
+
+
+
+
+
+
+## ⬇️ Zoo de Modelos
+
+Próximamente. Proporcionaremos pesos para modelos basados en SD3.5 y Flux.1.
+
+| Modelo | Base | Descripción | Descargar |
+| :--- | :--- | :--- | :--- |
+| **UniFit-SD3.5** | SD 3.5 Medium | Velocidad y calidad equilibradas (Recomendado) | [Enlace]() |
+| **UniFit-Flux** | Flux.1 Fill | Mayor fidelidad y adherencia al prompt | [Enlace]() |
+
+
+## 🚀 Inferencia
+
+*(Ejemplos de comandos - se actualizarán al publicar el código)*
+
+
+
+## 🙏 Reconocimiento
+Nuestro código está modificado a partir de [Diffusers](https://github.com/huggingface/diffusers). Utilizamos [Stable Diffusion 3.5 Medium](https://huggingface.co/stabilityai/stable-diffusion-3.5-medium) y [FLUX.1-Fill-dev](https://huggingface.co/black-forest-labs/FLUX.1-Fill-dev) como modelos base. Adoptamos [Qwen2-VL-2B-Instruct](https://huggingface.co/Qwen/Qwen2-VL-2B-Instruct) como el Módulo MGSA. Gracias a todos los colaboradores!