Publications

2026

  1. ICLR 2026
    FastCar: Cache Attentive Replay for Fast Auto-Regressive Video Generation on the Edge
    Xuan Shen, Weize Ma, Yufa Zhou, Enhao Tang, Yanyue Xie, Zhengang Li, Yifan Gong, Quanyi Wang, Henghui Ding, Yiwei Wang, Yanzhi Wang, Pu Zhao, Jun Lin, and Jiuxiang Gu
  2. AAAI 2026
    OIDA-QA: A Multimodal Benchmark for Analyzing the Opioid Industry Documents Archive
    Xuan Shen, Brian Wingenroth, Zichao Wang, Jason Kuen, Wanrong Zhu, Ruiyi Zhang, Yiwei Wang, Lichun Ma, Anqi Liu, Hongfu Liu, Tong Sun, Kevin S. Hawkins, Kate Tasker, G. Caleb Alexander, and Jiuxiang Gu
  3. CVPR 2026
    DiffGraph: An Automated Agent-driven Model Merging Framework for In-the-Wild Text-to-Image Generation
    Zhuoling Li, Hossein Rahmani, Jiarui Zhang, Yu Xue, Majid Mirmehdi, Jason Kuen, Jiuxiang Gu, and Jun Liu
  4. ge2026chimera.jpg
    arXiv preprint arXiv:2607.28611, 2026
    Chimera: Designing and Chinchilla-Scaling Hybrid Visual Diffusion Transformers
    Chongjian Ge, Hanwen Jiang, Tianyu Wang, Jiuxiang Gu, Yiran Xu, Ziwen Chen, Shaoteng Liu, Jing Shi, Yicong Hong, Zefan Cai, Hailin Jin, and Hao Tan
  5. zhu2026flare.jpg
    arXiv preprint arXiv:2606.01774, 2026
    FLARE: Diffusion for Hybrid Language Models
    Yuchen Zhu, Jing Shi, Chongjian Ge, Hao Tan, Yiran Xu, Wanrong Zhu, Jason Kuen, Koustava Goswami, Rajiv Jain, Yongxin Chen, Molei Tao, and Jiuxiang Gu
  6. li2026sparselavida.jpg
    CVPR 2026
    Sparse-LaViDa: Sparse Multimodal Discrete Diffusion Language Models
    Shufan Li, Jiuxiang Gu, Kangning Liu, Zhe Lin, Zijun Wei, Aditya Grover, and Jason Kuen
  7. 2026
    LaViDa-R1: Advancing Reasoning for Unified Multimodal Diffusion Language Models
    Shufan Li, Wanrong Zhu, Jiuxiang Gu, Kangning Liu, Zhe Lin, Yiran Chen, Molei Tao, Aditya Grover, and Jason Kuen
  8. arXiv preprint arXiv:2601.04589, 2026
    MiLDEdit: Reasoning-Based Multi-Layer Design Document Editing
    Zhaoyang Lin, Wanrong Zhu, Jiuxiang Gu, Jaejun Kil, Chris Tensmeyer, Lingzhi Zhang, Shi Liu, Ruiyi Zhang, Lifu Huang, and others
  9. li2026lavidao.jpg
    ICLR 2026
    LaViDa-O: Elastic Large Masked Diffusion Models for Unified Multimodal Understanding and Generation
    Shufan Li, Jiuxiang Gu, Kangning Liu, Zhe Lin, Zijun Wei, Aditya Grover, and Jason Kuen

2025

  1. EMNLP 2025
    Commit: Coordinated instruction tuning for multimodal large language models
    Junda Wu, Xintong Li, Tong Yu, Yu Wang, Xiang Chen, Jiuxiang Gu, Lina Yao, Jingbo Shang, and Julian McAuley
  2. WACV 2025
    ARTIST: Improving the Generation of Text-rich Images with Disentangled Diffusion Models
    Jianyi Zhang, Yufan Zhou, Jiuxiang Gu, Curtis Wigington, Tong Yu, Yiran Chen, Tong Sun, and Ruiyi Zhang
  3. WACV 2025
    Differential privacy mechanisms in neural tangent kernel regression
    Jiuxiang Gu, Yingyu Liang, Zhizhou Sha, Zhenmei Shi, and Zhao Song
  4. Submitted to ACL 2025
    A multi-llm debiasing framework
    Deonna M Owens, Ryan A Rossi, Sungchul Kim, Tong Yu, Franck Dernoncourt, Xiang Chen, Ruiyi Zhang, Jiuxiang Gu, Hanieh Deilamsalehy, and Nedim Lipka
  5. ICLR 2025
    Imagefolder: Autoregressive image generation with folded tokens
    Xiang Li, Kai Qiu, Hao Chen, Jason Kuen, Jiuxiang Gu, Bhiksha Raj, and Zhe Lin
  6. ICLR 2025
    LoRA-Contextualizing Adaptation of Large Multimodal Models for Long Document Understanding
    Jian Chen, Ruiyi Zhang, Yufan Zhou, Tong Yu, Franck Dernoncourt, Jiuxiang Gu, Ryan A Rossi, Changyou Chen, and Tong Sun
  7. TMLR, 2025
    Personalization of large language models: A survey
    Zhehao Zhang, Ryan A Rossi, Branislav Kveton, Yijia Shao, Diyi Yang, Hamed Zamani, Franck Dernoncourt, Joe Barrow, Tong Yu, Sungchul Kim, and others
  8. shen2025numerical.jpg
    AAAI 2025
    Numerical pruning for efficient autoregressive models
    Xuan Shen, Zhao Song, Yufa Zhou, Bo Chen, Jing Liu, Ruiyi Zhang, Ryan A. Rossi, Hao Tan, Tong Yu, Xiang Chen, Yufan Zhou, Tong Sun, Pu Zhao, Yanzhi Wang, and Jiuxiang Gu
  9. AAAI 2025
    LazyDiT: Lazy Learning for the Acceleration of Diffusion Transformers
    Xuan Shen, Zhao Song, Yufa Zhou, Bo Chen, Yanyu Li, Yifan Gong, Kai Zhang, Hao Tan, Jason Kuen, Henghui Ding, Zhihao Shu, Wei Niu, Pu Zhao, Yanzhi Wang, and Jiuxiang Gu
  10. CVPR 2025
    MegaSynth: Scaling Up 3D Scene Reconstruction with Synthesized Data
    Hanwen Jiang, Zexiang Xu, Desai Xie, Ziwen Chen, Haian Jin, Fujun Luan, Zhixin Shu, Kai Zhang, Sai Bi, Xin Sun, and others
  11. ICCV 2025
    Refer to Anything with Vision-Language Prompts
    Shengcao Cao, Zijun Wei, Jason Kuen, Kangning Liu, Lingzhi Zhang, Jiuxiang Gu, HyunJoon Jung, Liang-Yan Gui, and Yu-Xiong Wang
  12. ICCV 2025
    DiffIP: Representation Fingerprints for Robust IP Protection of Diffusion Models
    Zhuoling Li, Haoxuan Qu, Jason Kuen, Jiuxiang Gu, Qiuhong Ke, Jun Liu, and Hossein Rahmani
  13. ICCV 2025
    Multimodal LLMs as Customized Reward Models for Text-to-Image Generation
    Shijie Zhou, Ruiyi Zhang, Huaisheng Zhu, Branislav Kveton, Yufan Zhou, Jiuxiang Gu, Jian Chen, and Changyou Chen
  14. arXiv preprint arXiv:2501.19201, 2025
    Efficient Reasoning with Hidden Thinking
    Xuan Shen, Yizhou Wang, Xiangxi Shi, Yanzhi Wang, Pu Zhao, and Jiuxiang Gu
  15. ACL 2025
    From Selection to Generation: A Survey of LLM-based Active Learning
    Yu Xia, Subhojyoti Mukherjee, Zhouhang Xie, Junda Wu, Xintong Li, Ryan Aponte, Hanjia Lyu, Joe Barrow, Hongjie Chen, Franck Dernoncourt, and others
  16. Submitted to NeurIPS 2025
    Efficient Reasoning with Hidden Thinking
    Xuan Shen, Yizhou Wang, Xiangxi Shi, Yanzhi Wang, Pu Zhao, and Jiuxiang Gu
  17. Submitted to NeurIPS 2025
    ADOPT: A Multimodal Framework for Document Understanding and Generation
    Jiuxiang Gu, Jing Shi, Wanrong Zhu, Rajiv Jain, Curtis Wigington, Jason Kuen, Ruiyi Zhang, Xuan Shen, and Tong Sun
  18. Submitted to NeurIPS 2025
    DraftAttention: Fast Video Diffusion via Low-Resolution Attention Guidance
    Xuan Shen, Chenxia Han, Yufa Zhou, Yanyue Xie, Yifan Gong, Quanyi Wang, Yiwei Wang, Yanzhi Wang, Pu Zhao, and Jiuxiang Gu
  19. Submitted to NeurIPS 2025
    MENTOR: Efficient Multimodal-Conditioned Tuning for Autoregressive Vision Generation Models
    Haozhe Zhao, Zefan Cai, Shuzheng Si, Liang Chen, Jiuxiang Gu, Wen Xiao, and Junjie Hu
  20. TMLR, 2025
    From Preferences to Prejudice: The Role of Alignment Tuning in Shaping Social Bias in Video Diffusion Models
    Zefan Cai, Haoyi Qiu, Haozhe Zhao, Ke Wan, Jiachen Li, Jiuxiang Gu, Wen Xiao, Nanyun Peng, and Junjie Hu
  21. NeurIPS 2025
    R-KV: Redundancy-aware KV Cache Compression for Reasoning Models
    Zefan Cai, Wen Xiao, Hanshi Sun, Cheng Luo, Yikai Zhang, Ke Wan, Yucheng Li, Yeyang Zhou, Li-Wen Chang, Jiuxiang Gu, Zhen Dong, Anima Anandkumar, Abedelkadir Asi, and Junjie Hu
  22. Submitted to NeurIPS 2025
    ADOPD-Instruct: A Large-Scale Multimodal Dataset for Document Editing
    Wanrong Zhu, Xiangxi Shi, Yufan Zhou, Ruiyi Zhang, Tong Sun, and Jiuxiang Gu
  23. ACL 2025
    Metal: A multi-agent framework for chart generation with test-time scaling
    Bingxuan Li, Yiwei Wang, Jiuxiang Gu, Kai-Wei Chang, and Nanyun Peng
  24. Submitted to ICCV 2025
    Robust Latent Matters: Boosting Image Generation with Sampling Error Synthesis
    Kai Qiu, Xiang Li, Jason Kuen, Hao Chen, Xiaohao Xu, Jiuxiang Gu, Yinyi Luo, Bhiksha Raj, Zhe Lin, and Marios Savvides
  25. CVPR 2025
    QuartDepth: Post-Training Quantization for Real-Time Depth Estimation on the Edge
    Xuan Shen, Weize Ma, Jing Liu, Changdi Yang, Rui Ding, Quanyi Wang, Henghui Ding, Wei Niu, Yanzhi Wang, Pu Zhao, and others
  26. 2025
    Towards Visual Text Grounding of Multimodal Large Language Model
    Ming Li, Ruiyi Zhang, Jian Chen, Jiuxiang Gu, Yufan Zhou, Franck Dernoncourt, Wanrong Zhu, Tianyi Zhou, and Tong Sun
  27. arXiv preprint arXiv:2512.14691, 2025
    MMGR: Multi-Modal Generative Reasoning
    Zefan Cai, Haoyi Qiu, Tengfei Ma, Haozhe Zhao, Geng Zhou, Kung-Hsiang Huang, Parisa Kordjamshidi, Meng Zhang, and others
  28. arXiv preprint arXiv:2512.12487, 2025
    More Than the Final Answer: Improving Visual Extraction and Logical Consistency in Vision-Language Models
    Hoang Anh Just, Yue Fan, Handong Zhao, Jiuxiang Gu, Ruiyi Zhang, Simon Jenni, Kushal Kafle, Ruoxi Jia, and Jing Shi

2024

  1. 2024
    Improving a Named Entity Recognizer Trained on Noisy Data with a Few Clean Instances
    Zhendong Chu, Ruiyi Zhang, Tong Yu, Rajiv Jain, Vlad I Morariu, Jiuxiang Gu, and Ani Nenkova
  2. hong2023lrm.jpg
    ICLR 2024 Oral
    Lrm: Large reconstruction model for single image to 3d
    Yicong Hong, Kai Zhang, Jiuxiang Gu, Sai Bi, Yang Zhou, Difan Liu, Feng Liu, Kalyan Sunkavalli, Trung Bui, and Hao Tan
  3. CVPR 2024
    Customization assistant for text-to-image generation
    Yufan Zhou, Ruiyi Zhang, Jiuxiang Gu, and Tong Sun
  4. ACL 2024
    Selective reflection-tuning: Student-selected data recycling for llm instruction-tuning
    Ming Li, Lichang Chen, Jiuhai Chen, Shwai He, Jiuxiang Gu, and Tianyi Zhou
  5. gu2024adopd.jpg
    ICLR 2024
    ADoPD: A large-scale document page decomposition dataset
    Jiuxiang Gu, Xiangxi Shi, Jason Kuen, Lu Qi, Ruiyi Zhang, Anqi Liu, Ani Nenkova, and Tong Sun
  6. ICLR 2024
    SOHES: Self-supervised open-world hierarchical entity segmentation
    Shengcao Cao, Jiuxiang Gu, Jason Kuen, Hao Tan, Ruiyi Zhang, Handong Zhao, Ani Nenkova, Liang-Yan Gui, Tong Sun, and Yu-Xiong Wang
  7. arXiv preprint arXiv:2405.03251, 2024
    Exploring the frontiers of softmax: Provable optimization, applications in diffusion model, and beyond
    Jiuxiang Gu, Chenyang Li, Yingyu Liang, Zhenmei Shi, and Zhao Song
  8. COLING 2024
    DocScript: Document-Level Script Event Prediction
    Puneet Mathur, Vlad I Morariu, Aparna Garimella, Franck Dernoncourt, Jiuxiang Gu, Ramit Sawhney, Preslav Nakov, Dinesh Manocha, and Rajiv Jain
  9. CVPR 2024
    Trins: Towards multimodal language models that can read
    Ruiyi Zhang, Yanzhe Zhang, Jian Chen, Yufan Zhou, Jiuxiang Gu, Changyou Chen, and Tong Sun
  10. arXiv preprint arXiv:2406.09305, 2024
    Toffee: Efficient million-scale dataset construction for subject-driven text-to-image generation
    Yufan Zhou, Ruiyi Zhang, Kaizhi Zheng, Nanxuan Zhao, Jiuxiang Gu, Zichao Wang, Xin Eric Wang, and Tong Sun
  11. CVPR 2024
    DocSynthv2: A Practical Autoregressive Modeling for Document Generation
    Sanket Biswas, Rajiv Jain, Vlad I Morariu, Jiuxiang Gu, Puneet Mathur, Curtis Wigington, Tong Sun, and Josep Lladós
  12. NAACL 2024
    Self-Cleaning: Improving a Named Entity Recognizer Trained on Noisy Data with a Few Clean Instances
    Zhendong Chu, Ruiyi Zhang, Tong Yu, Rajiv Jain, Vlad Morariu, Jiuxiang Gu, and Ani Nenkova
  13. ICML 2024
    Category-aware active domain adaptation
    Wenxiao Xiao, Jiuxiang Gu, and Hongfu Liu
  14. arXiv preprint arXiv:2407.19185, 2024
    Llava-read: Enhancing reading ability of multimodal language models
    Ruiyi Zhang, Yufan Zhou, Jian Chen, Jiuxiang Gu, Changyou Chen, and Tong Sun
  15. arXiv preprint arXiv:2408.14594, 2024
    Mmr: Evaluating reading ability of large multimodal models
    Jian Chen, Ruiyi Zhang, Yufan Zhou, Ryan Rossi, Jiuxiang Gu, and Changyou Chen
  16. EMNLP 2024
    TextLap: Customizing Language Models for Text-to-Layout Planning
    Jian Chen, Ruiyi Zhang, Yufan Zhou, Jennifer Healey, Jiuxiang Gu, Zhiqiang Xu, and Changyou Chen
  17. EMNLP 2024
    Advancing Vision-Language Models with Adapter Ensemble Strategies
    Yue Bai, Handong Zhao, Zhe Lin, Ajinkya Kale, Jiuxiang Gu, Tong Yu, Sungchul Kim, and Yun Fu
  18. arXiv preprint arXiv:2410.16400, 2024
    VipAct: Visual-perception enhancement via specialized vlm agent collaboration and tool-use
    Zhehao Zhang, Ryan Rossi, Tong Yu, Franck Dernoncourt, Ruiyi Zhang, Jiuxiang Gu, Sungchul Kim, Xiang Chen, Zichao Wang, and Nedim Lipka
  19. arXiv preprint arXiv:2410.20011, 2024
    A survey of small language models
    Chien Van Nguyen, Xuan Shen, Ryan Aponte, Yu Xia, Samyadeep Basu, Zhengmian Hu, Jian Chen, Mihir Parmar, Sasidhar Kunapuli, Joe Barrow, and others
  20. arXiv preprint arXiv:2412.01762, 2024
    XQ-GAN: An Open-source Image Tokenization Framework for Autoregressive Generation
    Xiang Li, Kai Qiu, Hao Chen, Jason Kuen, Jiuxiang Gu, Jindong Wang, Zhe Lin, and Bhiksha Raj
  21. arXiv preprint arXiv:2412.02142, 2024
    Personalized Multimodal Large Language Models: A Survey
    Junda Wu, Hanjia Lyu, Yu Xia, Zhehao Zhang, Joe Barrow, Ishita Kumar, Mehrnoosh Mirtaheri, Hongjie Chen, Ryan A Rossi, Franck Dernoncourt, and others
  22. arXiv preprint arXiv:2412.10533, 2024
    SUGAR: Subject-Driven Video Customization in a Zero-Shot Manner
    Yufan Zhou, Ruiyi Zhang, Jiuxiang Gu, Nanxuan Zhao, Jing Shi, and Tong Sun

2023

  1. ICCV 2023
    High-Quality Entity Segmentation
    Qi Lu, Jason Kuen, Shen Tiancheng, Gu Jiuxiang, Guo Weidong, Jia Jiaya, Lin Zhe, and Yang Ming-Hsuan
  2. WACV 2023
    LayerDoc: layer-wise extraction of spatial hierarchical structure in visually-rich documents
    Puneet Mathur, Rajiv Jain, Ashutosh Mehra, Jiuxiang Gu, Franck Dernoncourt, Quan Tran, Verena Kaynig-Fittkau, Ani Nenkova, Dinesh Manocha, Vlad I Morariu, and others
  3. ACL 2023
    A critical analysis of out-of-distribution detection for document understanding
    Jiuxiang Gu, Yifei Ming, Yi Zhou, Jason Kuen, Vlad I Morariu, Handong Zhao, Ruiyi Zhang, Nikolaos Barmpalios, Anqi Liu, Yixuan Li, and others
  4. ACL 2023
    Learning the visualness of text using large vision-language models
    Gaurav Verma, Ryan A Rossi, Christopher Tensmeyer, Jiuxiang Gu, and Ani Nenkova
  5. NeurIPS 2023
    AIMS: all-inclusive multi-level segmentation for anything
    Lu Qi, Jason Kuen, Weidong Guo, Jiuxiang Gu, Zhe Lin, Bo Du, Yu Xu, and Ming-Hsuan Yang
  6. AAAI 2023
    Docedit: language-guided document editing
    Puneet Mathur, Rajiv Jain, Jiuxiang Gu, Franck Dernoncourt, Dinesh Manocha, and Vlad I Morariu
  7. NeurIPS Workshop 2023
    Llavar: Enhanced visual instruction tuning for text-rich image understanding
    Yanzhe Zhang, Ruiyi Zhang, Jiuxiang Gu, Yufan Zhou, Nedim Lipka, Diyi Yang, and Tong Sun
  8. EMNLP 2023
    A critical analysis of document out-of-distribution detection
    Jiuxiang Gu, Yifei Ming, Yi Zhou, Jason Kuen, Vlad Morariu, Handong Zhao, Ruiyi Zhang, Nikolaos Barmpalios, Anqi Liu, Yixuan Li, and others
  9. NeurIPS Workshop 2023
    Reflection-tuning: Data recycling improves llm instruction-tuning
    Ming Li, Lichang Chen, Jiuhai Chen, Shwai He, Heng Huang, Jiuxiang Gu, and Tianyi Zhou

2022

  1. AAAI 2022
    UNISON: Unpaired cross-lingual image captioning
    Jiahui Gao, Yi Zhou, LH Philip, Shafiq Joty, and Jiuxiang Gu
  2. T-PAMI, 2022 Journal
    Open world entity segmentation
    Lu Qi, Jason Kuen, Yi Wang, Jiuxiang Gu, Hengshuang Zhao, Philip Torr, Zhe Lin, and Jiaya Jia
  3. CVPR 2022
    Open-vocabulary instance segmentation via robust cross-modal pseudo-labeling
    Dat Huynh, Jason Kuen, Zhe Lin, Jiuxiang Gu, and Ehsan Elhamifar
  4. CVPR 2022
    Towards language-free training for text-to-image generation
    Yufan Zhou, Ruiyi Zhang, Changyou Chen, Chunyuan Li, Chris Tensmeyer, Tong Yu, Jiuxiang Gu, Jinhui Xu, and Tong Sun
  5. ECCV 2022
    Ca-ssl: Class-agnostic semi-supervised learning for detection and segmentation
    Lu Qi, Jason Kuen, Zhe Lin, Jiuxiang Gu, Fengyun Rao, Dian Li, Weidong Guo, Zhen Wen, Ming-Hsuan Yang, and Jiaya Jia
  6. Big Data 2022
    User-entity differential privacy in learning natural language models
    Phung Lai, NhatHai Phan, Tong Sun, Rajiv Jain, Franck Dernoncourt, Jiuxiang Gu, and Nikolaos Barmpalios
  7. AAAI 2022
    Tigan: Text-based interactive image generation and manipulation
    Yufan Zhou, Ruiyi Zhang, Jiuxiang Gu, Chris Tensmeyer, Tong Yu, Changyou Chen, Jinhui Xu, and Tong Sun
  8. ACM Web 2022
    Fedkc: Federated knowledge composition for multilingual natural language understanding
    Haoyu Wang, Handong Zhao, Yaqing Wang, Tong Yu, Jiuxiang Gu, and Jing Gao
  9. ACL 2022
    Learning adaptive axis attentions in fine-tuning: Beyond fixed sparse attention patterns
    Zihan Wang, Jiuxiang Gu, Jason Kuen, Handong Zhao, Vlad Morariu, Ruiyi Zhang, Ani Nenkova, Tong Sun, and Jingbo Shang
  10. CVPR 2022
    Ei-clip: Entity-aware interventional contrastive learning for e-commerce cross-modal retrieval
    Haoyu Ma, Handong Zhao, Zhe Lin, Ajinkya Kale, Zhangyang Wang, Tong Yu, Jiuxiang Gu, Sunav Choudhary, and Xiaohui Xie
  11. NNACL 2022
    Doctime: A document-level temporal dependency graph parser
    Puneet Mathur, Vlad Morariu, Verena Kaynig-Fittkau, Jiuxiang Gu, Franck Dernoncourt, Quan Hung Tran, Ani Nenkova, Dinesh Manocha, and Rajiv Jain
  12. ECCV 2022
    Meta spatio-temporal debiasing for video scene graph generation
    Li Xu, Haoxuan Qu, Jason Kuen, Jiuxiang Gu, and Jun Liu
  13. INTERSPEECH 2022
    DocLayoutTTS: Dataset and Baselines for Layout-informed Document-level Neural Speech Synthesis.
    Puneet Mathur, Franck Dernoncourt, Quan Hung Tran, Jiuxiang Gu, Ani Nenkova, Vlad I Morariu, Rajiv Jain, and Dinesh Manocha
  14. ECCV 2022
    Improving the reliability for confidence estimation
    Haoxuan Qu, Yanchao Li, Lin Geng Foo, Jason Kuen, Jiuxiang Gu, and Jun Liu
  15. NeurIPS, 2022
    Delving into out-of-distribution detection with vision-language representations
    Yifei Ming, Ziyang Cai, Jiuxiang Gu, Yiyou Sun, Wei Li, and Yixuan Li
  16. EMNLP 2022
    MGDoc: Pre-training with multi-granular hierarchy for document image understanding
    Zilong Wang, Jiuxiang Gu, Chris Tensmeyer, Nikolaos Barmpalios, Ani Nenkova, Tong Sun, Jingbo Shang, and Vlad I Morariu

2021

  1. NAACL 2021
    Towards interpreting and mitigating shortcut learning behavior of NLU models
    Mengnan Du, Varun Manjunatha, Rajiv Jain, Ruchi Deshpande, Franck Dernoncourt, Jiuxiang Gu, Tong Sun, and Xia Hu
  2. CVPR 2021
    Multi-scale aligned distillation for low-resolution detection
    Lu Qi, Jason Kuen, Jiuxiang Gu, Zhe Lin, Yi Wang, Yukang Chen, Yanwei Li, and Jiaya Jia
  3. CVPR 2021
    Selfdoc: Self-supervised document representation learning
    Peizhao Li, Jiuxiang Gu, Jason Kuen, Vlad I Morariu, Handong Zhao, Rajiv Jain, Varun Manjunatha, and Hongfu Liu
  4. CVPR 2021
    Exploiting semantic embedding and visual feature for facial action unit detection
    Huiyuan Yang, Lijun Yin, Yi Zhou, and Jiuxiang Gu
  5. NeurIPS 2021
    Unidoc: Unified pretraining framework for document understanding
    Jiuxiang Gu, Jason Kuen, Vlad I Morariu, Handong Zhao, Rajiv Jain, Nikolaos Barmpalios, Ani Nenkova, and Tong Sun

2020

  1. PESGM 2020 Best Paper
    Resilient load restoration in microgrids considering mobile energy storage fleets: A deep reinforcement learning approach
    Shuhan Yao, Jiuxiang Gu, Huajun Zhang, Peng Wang, Xiaochuan Liu, and Tianyang Zhao
  2. ECCV 2020
    Finding it at another side: A viewpoint-adapted matching encoder for change captioning
    Xiangxi Shi, Xu Yang, Jiuxiang Gu, Shafiq Joty, and Jianfei Cai
  3. 2020
    Self-supervised relationship probing
    Jiuxiang Gu, Jason Kuen, Shafiq Joty, Jianfei Cai, Vlad Morariu, Handong Zhao, and Tong Sun

2019

  1. ICCV 2019
    Unpaired Image Captioning via Scene Graph Alignments
    Jiuxiang Gu, Shafiq Joty, Jianfei Cai, Handong Zhao, Xu Yang, and Gang Wang
  2. CVPR 2019
    Scene graph generation with external knowledge and image reconstruction
    Jiuxiang Gu, Handong Zhao, Zhe Lin, Sheng Li, Jianfei Cai, and Mingyang Ling
  3. ACM MM 2019
    Watch It Twice: Video Captioning with a Refocused Video Encoder
    Xiangxi Shi, Jianfei Cai, Shafiq Joty, and Jiuxiang Gu

2018

  1. gu2017stack.jpg
    AAAI 2018 Oral
    Stack-Captioning: Coarse-to-Fine Learning for Image Captioning
    Jiuxiang Gu, Jianfei Cai, Gang Wang, and Tsuhan Chen
  2. gu2017look.jpg
    CVPR 2018 Spotlight
    Look, Imagine and Match: Improving Textual-Visual Cross-Modal Retrieval with Generative Models
    Jiuxiang Gu, Jianfei Cai, Shafiq Joty, Li Niu, and Gang Wang
  3. Pattern Recognition, 2018
    Recent advances in convolutional neural networks
    Jiuxiang Gu, Zhenhua Wang, Jason Kuen, Lianyang Ma, Amir Shahroudy, Bing Shuai, Ting Liu, Xingxing Wang, Gang Wang, Jianfei Cai, and others
  4. Neurocomputing, 2018
    Video Captioning with Boundary-aware Hierarchical Language Decoding and Joint Video Prediction
    Xiangxi Shi, Jianfei Cai, Jiuxiang Gu, and Shafiq Joty
  5. ECCV 2018
    Unpaired image captioning by language pivoting
    Jiuxiang Gu, Shafiq Joty, Jianfei Cai, and Gang Wang
  6. TRECVID 2018
    NTU ROSE Lab at TRECVID 2018: Ad-hoc Video Search and Video to Text.
    Muhammet Bastan, Xiangxi Shi, Jiuxiang Gu, Zhao Heng, Chen Zhuo, Dennis Sng, and Alex C Kot

2017

  1. ICCV 2017
    An empirical study of language cnn for image captioning
    Jiuxiang Gu, Gang Wang, Jianfei Cai, and Tsuhan Chen

2014

  1. Journal of University of Chinese Academy of Sciences, 2014
    HJ-1C real-time image processing technology based on GPU
    GU Gu, Renzhong Yang, Lu Shi, and Hongwei Wei

2013

  1. Microelectronics & Computer, 2013
    Research of RS Decoding Technology Based on GPU
    Jiuxiang Gu, Ren-zhong YANG, and Hong-wei WEI

Patents

2026

  1. 2026
    Thinking with Anchors: Grounded and Efficient Document Reasoning
    Sichen Zhu, Yuchen Zhu, Wenzhuo Xu, Jason Kuen, Wanrong Zhu, Jing Shi, Xuan Shen, Quanyi Wang, Yiwei Wang, Yujun Cai, Bing Shuai, Qin Zhang, Yongxin Chen, Shilong Liu, Molei Tao, and Jiuxiang Gu
  2. 2026 US Patent App. 18/777,186
    Text rendering for image generation models
    Ruiyi Zhang, Jiuxiang Gu, Yufan Zhou, Curtis Wigington, Tong Yu, Jianyi Zhang, and Tong Sun
  3. 2026 US Patent 12,524,954
    Generating 3D models from a single image
    Hao Tan, Yicong Hong, Kai Zhang, Jiuxiang Gu, Sai Bi, Yang Zhou, Difan Liu, Feng Liu, Kalyan K Sunkavalli, Trung Huu Bui, and others

2025

  1. 2025 US Patent App. 18/347,877
    Efficient vision-language retrieval using structural pruning
    Handong Zhao, Yue Bai, Zhe Lin, Ajinkya Gorakhnath Kale, Jiuxiang Gu, Tong Yu, and Sungchul Kim
  2. 2025 US Patent App. 18/493,465
    Generating temporal dependency graphs
    Puneet Mathur, Vlad Morariu, Verena Kaynig-Fittkau, Jiuxiang Gu, Franck Dernoncourt, Quan Tran, Ani Nenkova, Dinesh Manocha, Rajiv Jain, and others
  3. 2025 US Patent App. 18/952,023
    Utilizing a generative neural network to interactively create and modify digital images based on natural language feedback
    Ruiyi Zhang, Yufan Zhou, Christopher Tensmeyer, Jiuxiang Gu, Tong Yu, and Tong Sun
  4. 2025 US Patent App. 18/460,747
    Generating 3d models from a single image
    Hao Tan, Yicong Hong, Kai Zhang, Jiuxiang Gu, Sai Bi, Yang Zhou, Difan Liu, Feng Liu, Kalyan K Sunkavalli, Trung Huu Bui, and others
  5. 2025 US Patent App. 18/528,116
    Position-based text-to-speech model
    Puneet Mathur, Franck Dernoncourt, Quan Hung Tran, Jiuxiang Gu, Ani Nenkova, Vlad Ion Morariu, Rajiv Bhawanji Jain, and Dinesh Manocha
  6. 2025 US Patent App. 18/472,746
    Generating an improved named entity recognition model using noisy data with a self-cleaning discriminator model
    Ruiyi Zhang, Zhendong Chu, Vlad Morariu, Tong Yu, Rajiv Jain, Nedim Lipka, and Jiuxiang Gu
  7. 2025 US Patent App. 19/239,469
    Unified pretraining framework for document understanding
    Jiuxiang Gu, Ani Nenkova, Nikolaos Barmpalios, Vlad I Morariu, Tong Sun, Rajiv Jain, and Jason Kuen

2024

  1. 2024 US Patent 11,886,815
    Self-supervised document representation learning
    Jiuxiang Gu, Vlad Morariu, Varun Manjunatha, Tong Sun, Rajiv Jain, Peizhao Li, Jason Kuen, and Handong Zhao
  2. 2024 US Patent 12,136,185
    Multi-scale distillation for low-resolution detection
    Jason Kuen, Jiuxiang Gu, and Zhe Lin
  3. 2024 US Patent 12,148,119
    Utilizing a generative neural network to interactively create and modify digital images based on natural language feedback
    Ruiyi Zhang, Yufan Zhou, Christopher Tensmeyer, Jiuxiang Gu, Tong Yu, and Tong Sun
  4. 2024 US Patent App. 17/947,737
    Image and semantic based table recognition
    Jiuxiang Gu, Vlad Morariu, Tong Sun, Jason Wen Yong Kuen, and Ani Nenkova
  5. 2024 US Patent App. 18/048,900
    Label induction
    Rajiv Bhawanji Jain, Michelle Yuan, Vlad Ion Morariu, Ani Nenkova Nenkova, Smitha Bangalore Naresh, Nikolaos Barmpalios, Ruchi Deshpande, Ruiyi Zhang, Jiuxiang Gu, Varun Manjunatha, and others
  6. 2024 US Patent App. 18/173,199
    Training language models and preserving privacy
    Franck Dernoncourt, Tong Sun, Thi Kim Phung Lai, Rajiv Bhawanji Jain, Nikolaos Barmpalios, and Jiuxiang Gu
  7. 2024 US Patent App. 18/055,752
    Extracting document hierarchy using a multimodal, layer-wise link prediction neural network
    Vlad Morariu, Puneet Mathur, Rajiv Jain, Ashutosh Mehra, Jiuxiang Gu, Franck Dernoncourt, N Anandhavelu, Quan Tran, Verena Kaynig-Fittkau, Nedim Lipka, and others
  8. 2024 US Patent 11,995,394
    Language-guided document editing
    Vlad Ion Morariu, Puneet Mathur, Rajiv Bhawanji Jain, Jiuxiang Gu, and Franck Dernoncourt
  9. 2024 US Patent App. 18/318,921
    TEXT-TO-IMAGE SYSTEM AND METHOD
    Ruiyi Zhang, Yufan Zhou, Tong Yu, Tong Sun, Rajiv Jain, Jiuxiang Gu, and Christopher Alan Tensmeyer
  10. 2024 US Patent App. 18/339,883
    IDENTIFYING VISUAL TEXT USING VISION-LANGUAGE MODELS
    Jiuxiang GU, Ryan Rossi, Gaurav Verma, Christopher Tensmeyer, and Ani Nenkova
  11. 2024 US Patent App. 18/328,950
    EFFICIENT AUGMENTATION FOR MULTIMODAL MACHINE LEARNING
    Handong Zhao, Yue Bai, Zhe Lin, Ajinkya Gorakhnath Kale, Jiuxiang Gu, Tong Yu, and Sungchul Kim

2023

  1. 2023 US Patent 11,610,393
    Knowledge distillation for neural networks using multiple augmentation strategies
    Jason Wen Yong Kuen, Zhe Lin, and Jiuxiang Gu
  2. 2023 US Patent 11,816,243
    Preserving user-entity differential privacy in natural language modeling
    Thi Kim Phung Lai, Tong Sun, Rajiv Jain, Nikolaos Barmpalios, Jiuxiang Gu, and Franck Dernoncourt
  3. 2023 US Patent App. 17/528,972
    Enhanced document visual question answering system via hierarchical attention
    Shijie Geng, Christopher Tensmeyer, Curtis Michael Wigington, and Jiuxiang Gu
  4. 2023 US Patent App. 17/577,605
    Facilitating identification of fillable regions in a form
    Ashutosh Mehra, Christopher Alan Tensmeyer, Vlad Ion Morariu, and Jiuxiang Gu
  5. 2023 US Patent App. 17/650,437
    Open vocabulary instance segmentation
    Jason Wen Yong Kuen, Dat Ba Huynh, Zhe Lin, and Jiuxiang Gu
  6. 2023 US Patent App. 17/740,497
    Adaptive sparse attention pattern
    Jiuxiang Gu, Zihan Wang, Jason Wen Yong Kuen, Handong Zhao, Vlad Ion Morariu, Ruiyi Zhang, Ani Nenkova Nenkova, and Tong Sun
  7. 2023 US Patent App. 17/664,079
    Systems and methods for product retrieval
    Handong Zhao, Haoyu Ma, Zhe Lin, Ajinkya Gorakhnath Kale, Tong Yu, Jiuxiang Gu, Sunav Choudhary, and Venkata Naveen Kumar Yadav Marri
  8. 2023 US Patent App. 17/746,779
    Multimodal extraction across multiple granularities
    Vlad Ion Morariu, Tong Sun, Nikolaos Barmpalios, Zilong Wang, Jiuxiang Gu, Ani Nenkova Nenkova, and Christopher Tensmeyer
  9. 2023 US Patent App. 17/806,097
    Open vocabulary instance segmentation with noise estimation and robust student
    Jason Wen Yong Kuen, Dat Ba Huynh, Zhe Lin, and Jiuxiang Gu

2022

  1. 2022 Patent
    Generating scene graphs from digital images using external knowledge and image reconstruction
    Handong Zhao, Zhe Lin, Sheng Li, Mingyang Ling, and Jiuxiang Gu
  2. 2022 US Patent App. 17/093,185
    Self-supervised visual-relationship probing
    Jiuxiang Gu, Vlad Ion Morariu, Tong Sun, Jason Wen Yong Kuen, and Handong Zhao
  3. 2022 US Patent App. 17/805,289
    Generating scene graphs from digital images using external knowledge and image reconstruction
    Handong Zhao, Zhe Lin, Sheng Li, Mingyang Ling, and Jiuxiang Gu