V

VisionLaya

Vision-enabled structured prediction model for calibrated image analysis

Visit VisionLaya ↗ link: rel="ugc noopener"

VisionLaya adds image input capabilities to the Laya decision model by integrating SmolVLM-256M-Instruct. It processes images with optional text to make calibrated, typed predictions in a single forward pass.

The model answers choice, score, and yes/no probability questions without text generation. It maintains Laya's predict(state, questions) API, proper-scoring-rule training, and temperature calibration for consistent, reliable outputs.

Discussion