V
VisionLaya
Vision-enabled structured prediction model for calibrated image analysis
Visit VisionLaya ↗
link: rel="ugc noopener"
VisionLaya adds image input capabilities to the Laya decision model by integrating SmolVLM-256M-Instruct. It processes images with optional text to make calibrated, typed predictions in a single forward pass.
The model answers choice, score, and yes/no probability questions without text generation. It maintains Laya's predict(state, questions) API, proper-scoring-rule training, and temperature calibration for consistent, reliable outputs.
Discussion