VLDeformer: Vision-Language Decomposed Transformer for Fast Cross-Modal Retrieval

Cross-model retrieval has emerged as one of the most important upgrades for text-only search engines (SE). Recently, with powerful representation for pairwise text-image inputs via early interaction, the accuracy of vision-language (VL) transformers has outperformed existing methods for text-image r...

Ausführliche Beschreibung

Gespeichert in:

Bibliographische Detailangaben
Veröffentlicht in:	arXiv.org 2021-11
Hauptverfasser:	Zhang, Lisai, Wu, Hongfa, Chen, Qingcai, Deng, Yimeng, Li, Zhonghua, Kong, Dejiang, Cao, Zhao, Siebert, Joanna, Han, Yunpeng
Format:	Artikel
Sprache:	eng
Schlagworte:	Acceleration Accuracy Coders Decomposition Learning Retrieval Transformers Vision
Online-Zugang:	Volltext
Tags:	Tag hinzufügen Keine Tags, Fügen Sie den ersten Tag hinzu!

Schreiben Sie den ersten Kommentar!