BPI-MVQA: a bi-branch model for medical visual question answering [PDF]
Background Visual question answering in medical domain (VQA-Med) exhibits great potential for enhancing confidence in diagnosing diseases and helping patients better understand their medical conditions.
Shengyan Liu +3 more
doaj +2 more sources
Vision–Language Model for Visual Question Answering in Medical Imagery
In the clinical and healthcare domains, medical images play a critical role. A mature medical visual question answering system (VQA) can improve diagnosis by answering clinical questions presented with a medical image.
Yakoub Bazi +3 more
doaj +3 more sources
Development of a large-scale medical visual question-answering dataset [PDF]
Background Medical Visual Question Answering (MedVQA) enhances diagnostic accuracy and healthcare delivery by leveraging artificial intelligence to interpret medical images.
Xiaoman Zhang +6 more
doaj +2 more sources
ECSA: Mitigating Catastrophic Forgetting and Few-Shot Generalization in Medical Visual Question Answering [PDF]
Objective: Medical Visual Question Answering (Med-VQA), a key technology that integrates computer vision and natural language processing to assist in clinical diagnosis, possesses significant potential for enhancing diagnostic efficiency and accuracy ...
Qinhao Jia +4 more
doaj +2 more sources
A linguistic lens into vision-language models for open-ended question-answers in medical visual question answering [PDF]
Objectives Medical Visual Question Answering (MedVQA) systems are predominantly evaluated using exact-match accuracy, which fails to account for partially correct or clinically insightful answers, particularly in open-ended question settings.
Aiman Lameesa +3 more
doaj +2 more sources
D2MNet: Difference-Aware Decoupling and Multi-Prompt Learning for Medical Difference Visual Question Answering [PDF]
Difference visual question answering (Diff-VQA) aims to answer questions by identifying and reasoning about differences between medical images. Existing methods often rely on simple feature subtraction or fusion to model image differences, while ...
Lingge Lai +3 more
doaj +2 more sources
Evaluating Bard Gemini Pro and GPT-4 Vision Against Student Performance in Medical Visual Question Answering: Comparative Case Study [PDF]
BackgroundThe rapid development of large language models (LLMs) such as OpenAI’s ChatGPT has significantly impacted medical research and education. These models have shown potential in fields ranging from radiological imaging interpretation to medical ...
Jonas Roos +2 more
doaj +2 more sources
Vision-language models for medical report generation and visual question answering: a review
Medical vision-language models (VLMs) combine computer vision (CV) and natural language processing (NLP) to analyze visual and textual medical data. Our paper reviews recent advancements in developing VLMs specialized for healthcare, focusing on publicly
Iryna Hartsock, Ghulam Rasool
doaj +3 more sources
PeFoMed: Parameter efficient fine-tuning of multimodal large language models for medical CXR [PDF]
Multimodal large language models (MLLMs) represent an evolutionary expansion in the capabilities of traditional large language models, enabling them to tackle challenges that surpass the scope of purely text-based applications.
Gang Liu +5 more
doaj +2 more sources
Correction: Evaluating Bard Gemini Pro and GPT-4 Vision Against Student Performance in Medical Visual Question Answering: Comparative Case Study [PDF]
Jonas Roos +2 more
doaj +2 more sources

