Uploaded July 2026 | Updated September 2026, 2 weeks ago
MARVIS transforms latent embedding spaces into visual representations and uses the spatial reasoning skills of vision-language models to interpret them for prediction, giving versatility without domain-specific training. With a single 3B-parameter model it achieves competitive performance across vision, audio, biological, and tabular domains, beating Gemini 2.0 by 16% on average. Code at github.com/penfever/marvis.
Speakers & affiliations: Benjamin Feuer (Stanford University), Lennart Purucker (Prior Labs), Oussama Elachqar (Oumi), Chinmay Hegde (New York University)
Session: Paper Session 8 — AI Systems in Practice · Friday, May 29
Key terms: vision-language models, embeddings, visualization, multimodal reasoning, tabular data, prediction
ACM Digital Library: doi.org/10.1145/3786335.3813150
MARVIS transforms latent embedding spaces into visual representations and uses the spatial reasoning skills of vision-language models to interpret them for prediction, giving versatility without domain-specific training. With a single 3B-parameter model it achieves competitive performance across vision, audio, biological, and tabular domains, beating Gemini 2.0 by 16% on average. Code at github.com/penfever/marvis.
Speakers & affiliations: Benjamin Feuer (Stanford University), Lennart Purucker (Prior Labs), Oussama Elachqar (Oumi), Chinmay Hegde (New York University)
Session: Paper Session 8 — AI Systems in Practice · Friday, May 29
Key terms: vision-language models, embeddings, visualization, multimodal reasoning, tabular data, prediction
ACM Digital Library: doi.org/10.1145/3786335.3813150










