千问杯:千问多模态推理挑战赛-挑战视觉认知极限
Qwen Cup: Qwen Multimodal Reasoning Challenge - Pushing the Limits of Visual Cognition
Qwen Cup: Qwen Multimodal Reasoning Challenge - Pushing the Limits of Visual Cognition
合作单位
阿里巴巴 ATH 事业群千问事业部
赛题简介
由阿里巴巴“千问”出题,聚焦多模态大模型在图文理解与复杂推理场景中的能力突破。本赛事诚邀全球AI开发者共同参与,以真实应用场景为驱动,探索多模态大模型从基础感知到深度推理的全链路能力进化。
赛题背景
随着通义千问App在全球范围内的广泛应用,用户对智能助手的期待已从单纯的文本对话,升级为"看图懂图、看图推理"的全能助手。然而,当前多模态模型在面对图文交织、空间逻辑、专业领域推演等复杂场景时,仍存在"幻觉"频发和推理能力断层等核心瓶颈。本赛题由阿里巴巴千问事业部出题,旨在联合全球AI开发者,突破多模态大模型在真实复杂场景下的感知与推理极限,共建下一代视觉推理大模型。赛事分为初赛与决赛两个阶段,从基础感知逐步进阶到专业领域深度推演,全面考验参赛者的模型训练与优化能力。
比赛任务
1. 初赛:多模态基础感知与常识推演
初赛阶段聚焦于千问App高频使用的生活应用与通用认知场景。参赛队伍需基于赛事方提供的基线模型(Qwen3.5-0.8B),自行构建或收集SFT训练数据进行训练优化,重点突破模型在数值计算、细粒度视觉感知、空间推理、物理常识推理及图文语义对齐等方面的能力。
| 核心考察维度: |
|---|
|
| 参赛队伍可在以下方向自主探索优化方案: |
|---|
|
2. 决赛:专业领域深度推演与强化学习
决赛阶段难度全面升级,聚焦千问App中的硬核专业解题与长逻辑链推演。参赛队伍将基于初赛阶段训练所得的SFT模型,综合运用强化学习算法优化、数据增强与合成、任务构建与奖励工程等技术手段,激发模型在多模态环境下的深度推理与自主思考能力。
| 核心考察维度: |
|---|
|
其他补充
- 赛题难点:本赛事的核心挑战在于多模态场景下的"精确感知-逻辑推理"闭环能力。模型不仅需要准确识别图像中的细粒度视觉信息,还需在此基础上完成多步逻辑推演,对模型的视觉编码精度、跨模态对齐能力和长链推理能力提出了极高要求。
- 技术限制:参赛队伍须以赛事方提供的基线模型(Qwen3.5-0.8B)为基础进行训练或架构改造,不得引入其他预训练模型的权重,一经发现将取消比赛资格。
- 提交要求:参赛队伍需提交模型权重文件及完整的技术方案报告。模型评测由赛事方统一执行,选手无需自行评测。
扫描二维码进选手答疑群:

