Skip to main navigation Skip to search Skip to main content

Instruction-ViT: Multi-modal prompts for instruction learning in vision transformer

  • Zhenxiang Xiao
  • , Yuzhong Chen
  • , Junjie Yao
  • , Lu Zhang
  • , Zhengliang Liu
  • , Zihao Wu
  • , Xiaowei Yu
  • , Yi Pan
  • , Lin Zhao
  • , Chong Ma
  • , Xinyu Liu
  • , Wei Liu
  • , Xiang Li
  • , Yixuan Yuan
  • , Dinggang Shen
  • , Dajiang Zhu
  • , Dezhong Yao
  • , Tianming Liu
  • , Xi Jiang
  • University of Electronic Science and Technology of China
  • University of Texas at Arlington
  • University of Georgia
  • Northwestern Polytechnical University Xian
  • Chinese University of Hong Kong
  • Mayo Clinic Scottsdale, AZ
  • Massachusetts General Hospital
  • ShanghaiTech University
  • Ltd.
  • Shanghai Clinical Research and Trial Center
  • Chinese Academy of Medical Sciences
  • Zhengzhou University

Research output: Contribution to journalArticlepeer-review

Original languageEnglish
Article number102204
JournalInformation Fusion
Volume104
DOIs
StatePublished - Apr 2024
Externally publishedYes

ASJC Scopus Subject Areas

  • Software
  • Signal Processing
  • Information Systems
  • Hardware and Architecture

Keywords

  • Instruction learning
  • Multi-modal information fusion
  • Multi-modal prompt
  • Vision transformer

Fingerprint

Dive into the research topics of 'Instruction-ViT: Multi-modal prompts for instruction learning in vision transformer'. Together they form a unique fingerprint.

Cite this