A minimal, efficient implementation of a Vision-Language Model following the LLaVA architecture.
astronomy reproducible-research model artificial-intelligence image-captioning lora clip visual-question-answering peft scientific-machine-learning huggingface-transformers large-language-models vision-language-model llava qwen multimodal-ai solar-imaging astronomical-imaging deepsdo astrollava
-
Updated
Aug 13, 2026 - Python