đŸ”¥Visual Instruction Tuning with GPT-4 !
We release LLaVA, a Language-and-Vision Assistant that exhibits some near multimodal GPT-4 level capabilities:
- đŸ¤–Visual Chat: 85% relative score of GPT-4
- đŸ§ªScience QA on reasoning: New SoTA 92.53%, beats multimodal chain-of-thoughts
Visual Instruction Tuning
abs: arxiv.org/abs/2304.08485
project page: llava-vl.github.io
@Gradio demo: llava.hliu.cc



