Publications

A collection of my research work. † denotes equal contribution.

ConceptFormer: Learning Adaptive Latent Concepts for Query-Document Alignment in Visual Document Retrieval

ConceptFormer: Learning Adaptive Latent Concepts for Query-Document Alignment in Visual Document Retrieval

Chunyi Peng, Zhipeng Xu, Yukun Yan, Zhenghao Liu, Others

arXiv preprint arXiv:2608.15698 2026

Code
HiEviDR-Bench: A Benchmark for Hierarchical Evidence Aggregation in Deep Research

HiEviDR-Bench: A Benchmark for Hierarchical Evidence Aggregation in Deep Research

Yubo Sun, Chunyi Peng, Yukun Yan, Zhenghao Liu, Others

arXiv preprint arXiv:2607.25151 2026

Code
Memory Shot for Long-Term Dialogue

Memory Shot for Long-Term Dialogue

Chunyi Peng, Haidong Xin, Liu Zhenghao, Others

arXiv preprint arXiv:2606.28338 2026

Code
CC-OCR V2: Fine-Grained Attribution of LMM Failures in Real-World Visual Document Understanding

CC-OCR V2: Fine-Grained Attribution of LMM Failures in Real-World Visual Document Understanding

Chunyi Peng, Zhipeng Xu, Shuai Bai, Dayiheng Liu, Others

arXiv preprint arXiv:2605.03903 2026

Code
Lang2Act: Fine-Grained Visual Reasoning through Self-Emergent Linguistic Toolchains

Lang2Act: Fine-Grained Visual Reasoning through Self-Emergent Linguistic Toolchains

Yuqi Xiong, Chunyi Peng, Zhenghao Liu, Zhipeng Xu, Others

ACL 2026

This paper introduces Lang2Act, a framework that improves fine-grained visual reasoning by letting VLMs use self-emergent linguistic toolchains instead of fixed external visual tools. It further uses a two-stage RL training scheme to first discover reusable linguistic tools and then optimize the model to apply them for downstream visual question answering.

Code
Mixture-of-Retrieval Experts for Reasoning-Guided Multimodal Knowledge Exploitation

Mixture-of-Retrieval Experts for Reasoning-Guided Multimodal Knowledge Exploitation

Chunyi Peng, Zhipeng Xu, Zhenghao Liu, Yukun Yan, Others

SIGIR 2026

This paper introduces MoRE, a multimodal RAG framework that lets MLLMs dynamically coordinate text, image, and table retrieval experts during reasoning. It further proposes Step-GRPO to train expert routing with fine-grained stepwise feedback, improving both answer accuracy and retrieval efficiency.

Code
VisRAG2.0: Mitigating Visual Hallucinations via Evidence-Guided Multi-Image Reasoning in Visual Retrieval-Augmented Generation

VisRAG2.0: Mitigating Visual Hallucinations via Evidence-Guided Multi-Image Reasoning in Visual Retrieval-Augmented Generation

Yubo Sun, Chunyi Peng, Yukun Yan, Zhenghao Liu, Others

ACM MM 2025

This paper introduces EVisRAG, a visual retrieval-augmented framework that improves multi-image reasoning by explicitly collecting question-relevant evidence from retrieved images before generating an answer. It also proposes RS-GRPO, a reward-scoped training strategy that strengthens evidence grounding and reduces visual hallucinations in visual question answering.

Code
UltraRAG v2: A Low-Code MCP Framework for Building Complex and Innovative RAG Pipelines

UltraRAG v2: A Low-Code MCP Framework for Building Complex and Innovative RAG Pipelines

Sen Mei, Haidong Xin, Chunyi Peng, Yukun Yan, Others

OpenBMB 2025

A Low-Code MCP Framework for Building Complex and Innovative Retrieval-Augmented Generation systems.

Code