千问杯:千问多模态推理挑战赛-挑战视觉认知极限
Qwen Cup: Qwen Multimodal Reasoning Challenge - Pushing the Limits of Visual Cognition

合作单位

阿里巴巴 ATH 事业群千问事业部


赛题简介

由阿里巴巴“千问”出题,聚焦多模态大模型在图文理解与复杂推理场景中的能力突破。本赛事诚邀全球AI开发者共同参与,以真实应用场景为驱动,探索多模态大模型从基础感知到深度推理的全链路能力进化。


赛题背景

随着通义千问App在全球范围内的广泛应用,用户对智能助手的期待已从单纯的文本对话,升级为"看图懂图、看图推理"的全能助手。然而,当前多模态模型在面对图文交织、空间逻辑、专业领域推演等复杂场景时,仍存在"幻觉"频发和推理能力断层等核心瓶颈。本赛题由阿里巴巴千问事业部出题,旨在联合全球AI开发者,突破多模态大模型在真实复杂场景下的感知与推理极限,共建下一代视觉推理大模型。赛事分为初赛与决赛两个阶段,从基础感知逐步进阶到专业领域深度推演,全面考验参赛者的模型训练与优化能力。


比赛任务

1.  初赛:多模态基础感知与常识推演

初赛阶段聚焦于千问App高频使用的生活应用与通用认知场景。参赛队伍需基于赛事方提供的基线模型(Qwen3.5-0.8B),自行构建或收集SFT训练数据进行训练优化,重点突破模型在数值计算、细粒度视觉感知、空间推理、物理常识推理及图文语义对齐等方面的能力。

核心考察维度:

  • 数值计算:图像多数值识别与精确运算。例如拍摄账单算总价、统计表格数据求和、票据金额提取与换算,考验模型跨区域数值定位与多步计算的准确性。
  • 计数能力:复杂图形元素清点。例如相交三角形统计、满屏干扰字母找茬,考验模型细粒度视觉注意力和抗干扰能力。
  • 空间推理:几何体折叠与展开。例如根据二维平面展开图,推断并选择正确的三维正方体形态,考验模型对二维与三维空间映射关系的理解能力。
  • 常识推理:物理常识应用。例如识别复杂水管连通结构,结合重力与连通器原理,推理出哪个杯子最先装满水,考验模型将视觉信息与物理常识进行联合推理的能力。
  • 图文联想:抽象隐喻理解。例如看图猜成语,考验模型跨模态语义的精准对齐能力。


参赛队伍可在以下方向自主探索优化方案:

  • 数据构建与筛选:参赛队伍可自行构建、收集或合成面向上述考察维度的SFT训练数据。数据质量与覆盖度是影响模型表现的关键因素,鼓励选手在数据来源多样性、标注质量、场景覆盖等方面进行深入探索。
  • 数据编排策略:参赛队伍可设计定制化的数据输入流程,包括但不限于课程式渐进学习、样本去重、训练顺序动态编排等方法,以提升训练效率和模型最终表现。
  • 超参数调优:参赛队伍可根据实际训练情况,灵活调整学习率、批次大小、优化器类型、学习率调度策略及正则化手段等训练超参数,寻找最优训练配置。


2.  决赛:专业领域深度推演与强化学习

决赛阶段难度全面升级,聚焦千问App中的硬核专业解题与长逻辑链推演。参赛队伍将基于初赛阶段训练所得的SFT模型,综合运用强化学习算法优化、数据增强与合成、任务构建与奖励工程等技术手段,激发模型在多模态环境下的深度推理与自主思考能力。

核心考察维度:

  • 代码解读与时空推演:伪代码截图的语义理解与逻辑分析。例如通过图片识别Python排序算法逻辑,并准确推导其最坏情况下的时间复杂度,考验模型从视觉符号到程序语义的跨模态解析与算法推理能力。
  • 专业领域推理(化学/数学):复杂学术图表的识别与专业推演。例如识别串联化学反应分子式,并以专业学术符号准确作答电环化和环加成反应类型,考验模型对专业领域视觉符号体系的理解与学术级推理能力。
  • 棋牌博弈推理:游戏残局的全局态势分析与策略推演。例如输入国际象棋残局截图,在规定步数内推导将死对策,并使用标准国际象棋记谱法输出完整步骤,考验模型多步博弈规划与结构化输出能力。
  • 抽象图形规律:矩阵图形的复合规律发现与逻辑推理。例如经典的九宫格IQ测试,要求模型发现图形在颜色、形状、位置上的复合变化规律,考验模型抽象模式归纳与视觉逻辑推理能力。
  • 强化学习算法设计:参赛选手可根据任务特点,自主选择并调优强化学习算法(如PPO、DPO、GRPO等),通过精细化的算法配置与参数搜索,更高效地激发模型的多模态推理潜力。
  • 数据构建与合成:参赛队伍可自行构建、收集或合成面向决赛考察维度的训练数据,也可基于初赛阶段积累的数据进行增强与扩展,为强化学习阶段提供更充分的训练信号与探索空间。
  • 任务构建与奖励工程:参赛队伍需围绕多模态推理能力的提升,设计针对性的训练任务与奖励函数体系。可探索的方向包括:分层难度的课程式任务编排、中间推理步骤的过程奖励、最终答案准确性与推理路径质量的综合评估等。科学的任务设计与奖励信号能够有效引导模型建立从视觉感知到深度推理的完整能力链路。


其他补充

  • 赛题难点:本赛事的核心挑战在于多模态场景下的"精确感知-逻辑推理"闭环能力。模型不仅需要准确识别图像中的细粒度视觉信息,还需在此基础上完成多步逻辑推演,对模型的视觉编码精度、跨模态对齐能力和长链推理能力提出了极高要求。
  • 技术限制:参赛队伍须以赛事方提供的基线模型(Qwen3.5-0.8B)为基础进行训练或架构改造,不得引入其他预训练模型的权重,一经发现将取消比赛资格。
  • 提交要求:参赛队伍需提交模型权重文件及完整的技术方案报告。模型评测由赛事方统一执行,选手无需自行评测。



扫描二维码进选手答疑群:




点击进入报名参赛