

如何打破大模型的“幻觉”迷雾,
让AI真正具备“看图推理”的深度视觉
认知能力?
阿里巴巴ATH事业群千问事业部始终走在全球大模型技术演进的最前沿。随着通义千问App在全球范围内的广泛应用,用户对智能助手的核心诉求,正经历从“单一文本交互”向“全能多模态理解”的跨越式转变。
立足于通用人工智能的未来布局,阿里巴巴千问事业部坚持以真实场景驱动技术迭代。在第五届琶洲算法大赛中发布的「千问杯:千问多模态推理挑战赛-挑战视觉认知极限」赛题,旨在联合全球AI开发者,突破多模态大模型在真实复杂场景下的感知与推理极限,共建下一代视觉推理大模型。
01 | 痛点突围:打破多模态大模型的认知瓶颈
随着多模态技术的深度推进,现代智能助手已被赋予了处理图文交织、空间逻辑等复杂任务的使命。然而,在真实的复杂场景中,当前的视觉大模型面临着严峻的考验:面对专业领域推演或密集的视觉干扰,模型极易产生“幻觉”频发和推理能力断层等核心痛点。
能否利用精准的数据编排与前沿的强化学习算法,破解多模态模型“看不清、算不准、推不出”的共性瓶颈? “千问杯”以“基础感知—常识推演—深度推理”为核心进化链路,为这一前沿技术领域提供了实战演练场。
过去的图文模型往往停留在浅层的“看图说话”,难以捕捉视觉元素背后的物理规律与数理逻辑;而通过本次赛题的算法优化,开发者将重塑模型的多模态认知中枢,实现从视觉符号到深度逻辑的精准映射。
02 | 赛题背后的核心价值:双赛段驱动的全链路能力进化
「千问杯:千问多模态推理挑战赛-挑战视觉认知极限」的提出,源于多模态大模型在落地应用中的长期痛点与迫切需求。为了全面考验并提升参赛者在真实复杂场景下的模型训练与优化能力,赛事被精心划分为两大阶梯式进阶阶段:
1. 初赛阶段:(7月10日-8月30日)
多模态基础感知与常识推演
初赛阶段聚焦于千问App高频使用的生活应用与通用认知场景。其核心考察维度包括数值计算(如账单算总价、表格数据求和等跨区域计算)、计数能力(如复杂图形清点与抗干扰)、空间推理(如二维展开图与三维几何体的形态映射)以及常识与图文联想(如物理常识应用与抽象隐喻理解)。参赛队伍需基于赛事方提供的基线模型(Qwen3.5-0.8B),自行构建或收集SFT训练数据进行训练优化。
2. 决赛阶段:(9月5日-9月28日)
专业领域深度推演与强化学习
决赛阶段难度全面升级,聚焦于硬核专业解题与长逻辑链推演。其核心考察维度涵盖代码解读与时空推演(如伪代码语义分析与时间复杂度推导)、专业领域推理(如复杂化学/数学学术图表的识别与推演)、棋牌博弈推理(如国际象棋残局多步博弈规划与标准记谱法输出)以及抽象图形规律(如九宫格IQ测试等复合规律发现)。参赛队伍将基于初赛阶段训练所得的SFT模型,综合运用强化学习算法优化、数据增强与合成、任务构建与奖励工程等技术手段,激发模型在多模态环境下的深度推理与自主思考能力。
03 | 核心难点:攻克“精确感知—逻辑推理”的闭环
如何真正攻克这道赛题,为大模型装上真正的“视觉推理大脑”?最大的技术挑战在于构建多模态场景下的“精确感知-逻辑推理”闭环能力。
模型不仅需要准确识别图像中的细粒度视觉信息,还必须在此基础上,完成复杂的多步逻辑推演。这对模型的视觉编码精度、跨模态对齐能力和长链推理能力提出了极高要求。
严格的技术边界与无限的探索空间: 参赛队伍必须基于赛事方提供的统一基线模型(Qwen3.5-0.8B)进行架构改造与训练,且严禁引入任何外部预训练模型权重。
● 在初赛阶段
选手需要极度考验自身在有限参数下,通过高质量SFT数据激发出模型潜在的物理与空间常识。
● 在决赛阶段
则需要在缺乏外部知识库的情况下,精细化设计奖励函数与强化算法,引导模型在专业学术领域和多步博弈规划中实现从视觉感知到深度推理的跨越。
赛题的攻克对下一代多模态大模型的演进具有决定性意义。它将推动大模型从“被动视觉特征提取器”向“主动视觉逻辑推演专家”升级,引领通用人工智能迈向全新的高度。
报名直通车
以赛聚智,探索视觉认知新极限!
「千问杯:千问多模态推理挑战赛-挑战视觉认知极限」报名火热进行中!
我们诚邀全球AI精英、算法极客同台竞技,共同突破多模态复杂推理的算力与算法边界,共筑智能未来!
立即扫码报名,获取最新基线模型及参赛指引,开启你的视觉大模型进化之旅!
【扫码直通报名赛道】

【千问杯赛题咨询群】

第五届琶洲算法大赛报名官网: https://www.aicompetition-pz.com

