StyleForge 用超图与反事实推理挑家具,R@1 从 22.8 提到 79.1

StyleForge: Indoor Furniture Styling by Counterfactual Reasoning in a Hypergraph Field

Lingwei Dang, Shishuo Shang, Pan Liu, Jiajia Cheng, Ziyan Qiu, Zhenhao Zhang, Yufei Zhu, Shenghui Huang, Qingxin Xiao, Yun Hao, Juntong Li, Qingyao Wu

cs.CV

2026-08-03

逐件检索挑家具 R@1 只有 22.8 还不协调;StyleForge 用超图加反事实马氏距离做整房联合优化,R@1 提到 79.1,均分 4.59 近乎追平人工。

这篇在解决什么

给定一个房间的固定布局(每件家具的类型、位置、朝向、大小都定了),任务是给每个家具位挑一个具体的 3D 资产,让整个房间风格协调。难点在于:单看一件家具,它只携带部分风格语义,真正的房间风格来自多件家具之间空间、功能、全局的关系。现有做法基本是每个槽位独立检索(ULIP、OpenShape、Uni3D 这类用 CLIP 式表示逐件打分),结果把各自还行的资产拼到一起,形状、材质、颜色就打架;少数用关系的方法又只靠固定的两两边,表达不出随布局和风格变化的高阶依赖。StyleForge 解决的是这个逐件检索导致整体不协调的失配。

方法

StyleForge 把家具风格选择建模成所有槽位的联合优化,而非逐件排序,核心几块:

结果

3D-FRONT 数据集(7100 训练房间、800 测试房间),GPT-4o 打分(AES 美学、C&M 色彩材质、SC 风格协调、R&G 真实几何,1–5 分):

方法Final R@1平均分
ULIP33.93.04
OpenShape35.13.08
Uni3D36.33.14
MetaFind44.54.25
StyleForge79.14.59
人工搭配(GT)4.63

初始化的检索 R@1 只有 22.8,场景级优化后到 79.1,平均分 4.59 已经和人工搭配的 4.63 几乎打平。消融里只留检索先验是 22.8,加超图和迭代但不加反事实几乎不动,加上马氏距离反事实才跳到 79.1。按房型分,卧室 82.4、餐厅 80.6,客厅(槽位多)75.8 最低。专业设计师盲评,高分档认可率 86.1%(95% CI 71.3%–93.9%),低分档只有 22.2%。

为什么重要

对做 3D 场景和资产生成的人,StyleForge 给了一个清晰的方法论转向:从逐件检索转到整房联合优化,并且把测试时训练用在推理阶段(冻结大模型、只调当前房间的 logits),成本可控。马氏距离对欧氏距离那一刀也值得记住:在风格这种有的维度强约束、有的维度无所谓的结构上,带可学方差的距离度量明显更准。从结果看,它已经把自动搭配推到接近人工水平,对室内设计自动化是实打实的进展。

局限与存疑

作者承认最大的限制:整个流程依赖初始检索器的召回,如果正确的资产没进 top-K,后续场景级优化再也捞不回来,他们未来想用场景级反馈动态更新检索 query。还有两点:评测主依赖 GPT-4o 打分,虽然配了设计师盲评,但 R@1 这种「命中人工标注」的指标本身就假定人工搭配是唯一正解,而家具搭配有多解;推理时每个房间都要跑一轮 TTT(到 200 步),实时性如何没说清。

术语

原文与代码

相关论文

全部论文解读