Back to feed
arXiv cs.LG
arXiv cs.LG
7/24/2026
Multimodal CoLRAG-TF: Triple-Filtered Retrieval for Complex PDFs

Multimodal CoLRAG-TF: Triple-Filtered Retrieval for Complex PDFs

Short summary

Multimodal CoLRAG-TF is a four-axis fusion architecture combining dense text embeddings, BM25 keyword matching, knowledge-graph triple filtering, and image similarity for RAG over complex PDFs. Built on 2,403 blocks from 43 Japanese disaster lesson PDFs with 11,414 extracted OpenIE triples, the system achieves 0.9909 retrieval recall and 71.6% improvement in multi-hop answer similarity over single-hop queries. Bayesian optimization reveals the triple axis must dominate (alpha=0.44) to sustain multi-hop retrieval quality, demonstrating that triple-filtered multimodal fusion is essential for noisy heterogeneous documents.

  • Four-axis fusion (dense embeddings, BM25, KG triples, image similarity) achieves 0.9909 retrieval recall on complex PDFs
  • Knowledge-graph triple filtering dominates fusion weights (alpha=0.44) to counteract lexical bias in multi-hop queries
  • 71.6% improvement in multi-hop answer similarity over single-hop queries on 457-pair benchmark from Japanese disaster documents

Generated with AI, which can make mistakes.

Is this a good recommendation for you?

Comments

Failed to load comments. Please try again.

Explore more