Compact vision-language model with always-on reasoning for visual tasks.
Add a second model to compare.