Add SALMONN, video-SALMONN, video-SALMONN 2 #184

TCL606 · 2024-10-14T01:51:38Z

Hello! Could you please add SALMONN series models?

Title	Venue	Date	Code	Demo
SALMONN: Towards Generic Hearing Abilities for Large Language Models	ICLR	2023-10-20	Github	-
video-SALMONN: Speech-Enhanced Audio-Visual Large Language Models	ICML	2024-06-22	Github	-
Enhancing Multimodal LLM for Detailed and Accurate Video Captioning using Multi-Round Preference Optimization	arXiv	2024-10-09	-	Demo

xjtupanda · 2024-10-29T14:18:46Z

Thanks for sharing! We've incorporated these works.
Please also consider citing our works:

@article{fu2023mme,
  title={MME: A Comprehensive Evaluation Benchmark for Multimodal Large Language Models},
  author={Fu, Chaoyou and Chen, Peixian and Shen, Yunhang and Qin, Yulei and Zhang, Mengdan and Lin, Xu and Yang, Jinrui and Zheng, Xiawu and Li, Ke and Sun, Xing and others},
  journal={arXiv preprint arXiv:2306.13394},
  year={2023}
}

@article{fu2024vita,
  title={VITA: Towards Open-Source Interactive Omni Multimodal LLM},
  author={Fu, Chaoyou and Lin, Haojia and Long, Zuwei and Shen, Yunhang and Zhao, Meng and Zhang, Yifan and Wang, Xiong and Yin, Di and Ma, Long and Zheng, Xiawu and He, Ran and Ji, Rongrong and Wu, Yunsheng and Shan, Caifeng and Sun, Xing},
  journal={arXiv preprint arXiv:2408.05211},
  year={2024}
}

@article{fu2024video,
  title={Video-MME: The First-Ever Comprehensive Evaluation Benchmark of Multi-modal LLMs in Video Analysis},
  author={Fu, Chaoyou and Dai, Yuhan and Luo, Yondong and Li, Lei and Ren, Shuhuai and Zhang, Renrui and Wang, Zihan and Zhou, Chenyu and Shen, Yunhang and Zhang, Mengdan and others},
  journal={arXiv preprint arXiv:2405.21075},
  year={2024}
}

@article{yin2023survey,
  title={A survey on multimodal large language models},
  author={Yin, Shukang and Fu, Chaoyou and Zhao, Sirui and Li, Ke and Sun, Xing and Xu, Tong and Chen, Enhong},
  journal={arXiv preprint arXiv:2306.13549},
  year={2023}
}

@article{yin2023woodpecker,
  title={Woodpecker: Hallucination correction for multimodal large language models},
  author={Yin, Shukang and Fu, Chaoyou and Zhao, Sirui and Xu, Tong and Wang, Hao and Sui, Dianbo and Shen, Yunhang and Li, Ke and Sun, Xing and Chen, Enhong},
  journal={arXiv preprint arXiv:2310.16045},
  year={2023}
}

Provide feedback

Saved searches

Use saved searches to filter your results more quickly

Add SALMONN, video-SALMONN, video-SALMONN 2 #184

Add SALMONN, video-SALMONN, video-SALMONN 2 #184

TCL606 commented Oct 14, 2024

xjtupanda commented Oct 29, 2024 •

edited

Loading

Add SALMONN, video-SALMONN, video-SALMONN 2 #184

Add SALMONN, video-SALMONN, video-SALMONN 2 #184

Comments

TCL606 commented Oct 14, 2024

xjtupanda commented Oct 29, 2024 • edited Loading

xjtupanda commented Oct 29, 2024 •

edited

Loading