Compact vision-language model with always-on reasoning for visual tasks.
Add a second model to compare.
This model hasn't been benchmarked yet.