George Pantazopoulos
Open Menu
Close Menu
Bio
Papers
Experience
Projects
Paper-Conference
Retrievit: In-context retrieval capabilities of transformers, state space models, and hybrid architectures
Jun 1, 2026
An Efficient Training Pipeline for Reasoning Graphical User Interface Agents
Mar 1, 2026
Evaluating Multimodal Language Models as Visual Assistants for Visually Impaired Users
Jul 1, 2025
CROPE: Evaluating In-Context Adaptation of Vision and Language Models to Culture-Specific Concepts
Jul 1, 2025
Shaking Up VLMs: Comparing Transformers and Structured State Space Models for Vision & Language Modeling
Jul 1, 2024
Lost in Space: Probing Fine-grained Spatial Understanding in Vision and Language Resamplers
Jul 1, 2024
Enhancing Continual Learning in Visual Question Answering with Modality-Aware Feature Distillation
Jul 1, 2024
Multitask Multimodal Prompted Training for Interactive Embodied Task Completion
Jul 1, 2023
Combine to Describe: Evaluating Compositional Generalization in Image Captioning
Jul 1, 2022