﻿<?xml version="1.0" encoding="utf-8"?>
<ArticleSet>
  <ARTICLE>
    <Journal>
      <PublisherName>مرکز منطقه ای اطلاع رسانی علوم و فناوری</PublisherName>
      <JournalTitle>فصلنامه فناوری اطلاعات و ارتباطات ایران</JournalTitle>
      <ISSN>2717-0411</ISSN>
      <Volume>18</Volume>
      <Issue>68</Issue>
      <PubDate PubStatus="epublish">
        <Year>2026</Year>
        <Month>9</Month>
        <Day>11</Day>
      </PubDate>
    </Journal>
    <ArticleTitle>A Systematic Review of Trustworthiness, Hallucination, and Safety in Large Vision-Language Models</ArticleTitle>
    <VernacularTitle>مروری نظام مند بر قابلیت اعتماد، توهم و ایمنی در مدل‌های بزرگ بینایی-زبان</VernacularTitle>
    <FirstPage>171</FirstPage>
    <LastPage>197</LastPage>
    <ELocationID EIdType="doi" />
    <Language>fa</Language>
    <AuthorList>
      <Author>
        <FirstName>دلارام</FirstName>
        <LastName>کیانی</LastName>
        <Affiliation>دانشگاه تهران</Affiliation>
      </Author>
      <Author>
        <FirstName> حانیه</FirstName>
        <LastName> نادری</LastName>
        <Affiliation>دانشگاه صنعتی شریف</Affiliation>
      </Author>
    </AuthorList>
    <History PubStatus="received">
      <Year>2026</Year>
      <Month>4</Month>
      <Day>18</Day>
    </History>
    <Abstract>&lt;p style="direction: ltr;"&gt;Large Vision&amp;ndash;Language Models (LVLMs), despite their remarkable progress in multimodal tasks, continue to face two fundamental reliability challenges: the generation of hallucinatory content inconsistent with visual evidence, and vulnerability to adversarial attacks that bypass safety mechanisms. This systematic review, conducted in accordance with the PRISMA 2020 reporting framework, covers studies published from January 2022 to June 2026 and synthesizes 31 eligible studies. It investigates the technical roots of hallucination across multiple levels (object, attribute, relation, and narrative), visual jailbreak mechanisms, and mitigation strategies at both training and inference stages. The findings indicate that over-reliance on linguistic priors is a common underlying factor behind many hallucination errors and safety failures, and that purely text-based alignment is insufficient for multimodal systems. Furthermore, a significant gap exists between current evaluation capabilities and the real-world complexity of vulnerabilities, hindering comprehensive reliability assessment. This review provides an integrated taxonomy of vulnerabilities and outlines a research roadmap, offering a structured foundation for the development of more reliable vision&amp;ndash;language models.&lt;/p&gt;</Abstract>
    <OtherAbstract Language="FA">&lt;p&gt;مدل&amp;zwnj;های بزرگ بینایی-زبان با وجود پیشرفت&amp;zwnj;های چشمگیر در وظایف چندوجهی، همچنان با دو چالش بنیادین قابلیت اعتماد روبه&amp;zwnj;رو هستند: تولید محتوای توهمی ناسازگار با شواهد بصری، و آسیب&amp;zwnj;پذیری در برابر حملات خصمانه که سازوکارهای ایمنی را دور می&amp;zwnj;زنند. این مرور نظام&amp;zwnj;مند، با پیروی از چارچوب گزارش&amp;zwnj;دهی پریزما ۲۰۲۰، مطالعات منتشرشده از ژانویه ۲۰۲۲ تا ژوئن ۲۰۲۶ را پوشش می&amp;zwnj;دهد و ۳۱ مطالعه واجد شرایط را ترکیب و تحلیل می&amp;zwnj;کند. این مطالعه ریشه&amp;zwnj;های فنی توهم در سطوح مختلف شامل شیء، ویژگی، رابطه و روایت، سازوکارهای گریز امنیتی بصری و راهبردهای کاهش در زمان آموزش و استنتاج را بررسی می&amp;zwnj;کند. یافته&amp;zwnj;های این مطالعه نشان می&amp;zwnj;دهد که اتکای بیش از حد به پیشین&amp;zwnj;های زبانی، ریشه مشترک بسیاری از خطاهای توهمی و شکست&amp;zwnj;های ایمنی است و هم&amp;zwnj;ترازی صرفاً متنی برای سیستم&amp;zwnj;های چندوجهی کافی نیست. همچنین، شکاف معناداری میان توانمندی&amp;zwnj;های ارزیابی فعلی و پیچیدگی واقعی آسیب&amp;zwnj;پذیری&amp;zwnj;ها وجود دارد که مانع سنجش جامع قابلیت اعتماد می&amp;zwnj;شود. این مرور با ارائه رده&amp;zwnj;بندی یکپارچه از آسیب&amp;zwnj;پذیری&amp;zwnj;ها و نقشه راه پژوهشی، چارچوبی برای توسعه مدل&amp;zwnj;های قابل اعتمادتر فراهم می&amp;zwnj;آورد.&lt;/p&gt;</OtherAbstract>
    <ObjectList>
      <Object Type="Keyword">
        <Param Name="Value">مدل‌های بینایی-زبان، قابلیت اعتماد؛ توهم، ایمنی چندوجهی، جیل‌بریک بصری</Param>
      </Object>
    </ObjectList>
    <ArchiveCopySource DocType="Pdf">http://jour.aicti.ir/fa/Article/Download/53399</ArchiveCopySource>
  </ARTICLE>
</ArticleSet>