Visual Content Captioning and Audio Conversion using CNN-RNN with Attention Model
The primary objective of this research is to develop an image captioning and audio conversion system based on Convolutional Neural Networks (CNN) and Recurrent Neural Networks (RNN) with the integration of an Attention Mechanism, aimed at improving ...
Aldy Agil Hermanto +3 more
doaj
Generative Distribution Prediction: A Unified Approach to Multimodal Learning. [PDF]
Tian X, Shen X.
europepmc +1 more source
Rare-Disease Diagnosis on the ZebraMap Multimodal Case Report Dataset: A Hybrid Pipeline with Grounded Explainability. [PDF]
Islam MS, Jamal A, Alkhathlan A.
europepmc +1 more source
A framework for efficient scientific diagram captioning using mixture-of-experts and low-rank adaptation. [PDF]
Kamboj D, Harit G.
europepmc +1 more source
MAFF is a transcription factor that regulates contraction-induced skeletal muscle transcription. [PDF]
Fukushima T +3 more
europepmc +1 more source
TC3-VLM: A Vision-Language Model for Tactical Combat Casualty Care. [PDF]
Kim J +5 more
europepmc +1 more source
Human-like scene graph generation and evaluation. [PDF]
Milewski V, Moens MF, Trusca MM.
europepmc +1 more source
GME-Init: Gamma-Moment Equalization for LoRA Initialization in Parameter-Efficient Fine-Tuning. [PDF]
Lin Y, Li C, Shen Z, Liu J, Zeng M.
europepmc +1 more source
Automated Generation and Human Evaluation of Neurosurgical Board Examination Self-Assessment Questions. [PDF]
Alyakin A +18 more
europepmc +1 more source
Aerodynamic limits of gliding flight in grey-headed albatrosses under variable wind conditions. [PDF]
Schoombie J, Craig KJ, Smith L.
europepmc +1 more source

