看图想创业点子:多模态基准 MBA-Bench,7B 小模型多项指标反超 GPT-5-mini

MBA: Multimodal Benchmark and Agents for Real-World Business Ideation

Hojun Choi, Jaeyo Shin, Suin Lee, Hyunjung Shim

cs.AI, cs.CV, cs.LG

2026-08-12

提出首个多模态创业 ideation 基准 MBA-Bench(30K 样本,六个领域),用 LoRA+GRPO 训的 7B agent 在多数维度反超 GPT-5-mini,比纯文本/多模态基线高出 64%~77%。

这篇在解决什么

用 LLM agent 帮人想创业点子(business ideation)是个新方向,但现有做法都困在纯文本里:喂给它一段场景描述,让它产出点子。可真实世界是多模态的,一张拥挤的街景、一个手机界面布局、一块电路板,里有文字传达不出的视觉线索,可能正好指向一个未被满足的需求。

这篇要把创业 ideation 从文本推进到多模态,并为此搭了第一个多模态基准 MBA-Bench,以及在这个基准上训练的 agent。

方法

MBA-Bench 有 30K 样本,覆盖六个领域,每个领域挑了文字说不全、得看图的特征:日常场景(ADE20K)、手机界面密集布局(RICO)、人群拥挤图(COCO,至少 10 人)、表面瑕疵(VisA 异常检测图)、材质纹理(DTD)、电路板结构(DeepPCB)。

每张图配文字描述,围绕三个商业问题(成本效率、技术、用户体验)各生成五个参考点子(用 GPT-4o,经检索词生成、市场证据检索、证据增强综合)。评测用 MLLM-as-a-Judge 打六个维度:具体性、技术有效性、创新性、竞争优势、需求有效性、市场规模。

agent 基于 Qwen2.5-VL-7B-Instruct,先 LoRA 监督微调再 GRPO 强化。两个变体:MBA-b(盲,只知道创造力和可行性两个奖励)和 MBA-k(已知,额外把六个公开评测维度也加进奖励,共八个目标)。

结果

两个训练版的小模型都明显超过基线。

模型相对纯文本基线相对多模态基线
MBA-b-7B+63.9%+25.6%
MBA-k-7B+77.1%+35.8%

MBA-k(知道评分标准)比 MBA-b(盲)更强,说明把评测维度公开给训练是有用的。在六项分维度上,7B 的 MBA-k 在创新性(4.00)、竞争优势(3.32)、需求有效性(2.94)、市场规模(2.75)上反超 GPT-5-mini,具体性(3.99)基本打平,只有技术有效性(3.00 对 3.07)略低。一个 7B 微调模型在多数维度上追上甚至超过闭源旗舰,主要赢在创新性和市场判断这类发散指标。

为什么重要

对做垂直 agent 的团队,这是个「小模型加任务对齐训练加清晰奖励」能在特定任务上追平大模型的样本。它也示范了一种造基准的思路:把视觉信息设成文本传达不全的硬门槛,逼 agent 真的去看图。

把 ideation 这类本就主观发散的任务,落成六个可打分的维度加强化学习奖励,是个可复用的工程套路。

局限与存疑

作者承认三条:只覆盖图像和文本,缺音频、触觉、嗅觉等其他感官信号;没有时间维度的推理,而视频能提供行为和因果上下文;不个性化,生成的点子不考虑创业者的资金、专长、地域、人脉和风险偏好,同一个点子对一个人合适,对另一个人可能完全不现实。

另一点:六个评测维度靠 MLLM 当裁判打分,而训练 MBA-k 时又把这些维度当奖励,裁判和奖励同源,这里存在自评放大的风险,论文没单独做人类评分交叉验证。

术语

原文与代码

相关论文

全部论文解读