StyleForge: Indoor Furniture Styling by Counterfactual Reasoning in a Hypergraph Field
Lingwei Dang, Shishuo Shang, Pan Liu, Jiajia Cheng, Ziyan Qiu, Zhenhao Zhang, Yufei Zhu, Shenghui Huang, Qingxin Xiao, Yun Hao, Juntong Li, Qingyao Wu
cs.CV
2026-08-03
逐件检索挑家具 R@1 只有 22.8 还不协调;StyleForge 用超图加反事实马氏距离做整房联合优化,R@1 提到 79.1,均分 4.59 近乎追平人工。
给定一个房间的固定布局(每件家具的类型、位置、朝向、大小都定了),任务是给每个家具位挑一个具体的 3D 资产,让整个房间风格协调。难点在于:单看一件家具,它只携带部分风格语义,真正的房间风格来自多件家具之间空间、功能、全局的关系。现有做法基本是每个槽位独立检索(ULIP、OpenShape、Uni3D 这类用 CLIP 式表示逐件打分),结果把各自还行的资产拼到一起,形状、材质、颜色就打架;少数用关系的方法又只靠固定的两两边,表达不出随布局和风格变化的高阶依赖。StyleForge 解决的是这个逐件检索导致整体不协调的失配。
StyleForge 把家具风格选择建模成所有槽位的联合优化,而非逐件排序,核心几块:
3D-FRONT 数据集(7100 训练房间、800 测试房间),GPT-4o 打分(AES 美学、C&M 色彩材质、SC 风格协调、R&G 真实几何,1–5 分):
| 方法 | Final R@1 | 平均分 |
| ULIP | 33.9 | 3.04 |
| OpenShape | 35.1 | 3.08 |
| Uni3D | 36.3 | 3.14 |
| MetaFind | 44.5 | 4.25 |
| StyleForge | 79.1 | 4.59 |
| 人工搭配(GT) | — | 4.63 |
初始化的检索 R@1 只有 22.8,场景级优化后到 79.1,平均分 4.59 已经和人工搭配的 4.63 几乎打平。消融里只留检索先验是 22.8,加超图和迭代但不加反事实几乎不动,加上马氏距离反事实才跳到 79.1。按房型分,卧室 82.4、餐厅 80.6,客厅(槽位多)75.8 最低。专业设计师盲评,高分档认可率 86.1%(95% CI 71.3%–93.9%),低分档只有 22.2%。
对做 3D 场景和资产生成的人,StyleForge 给了一个清晰的方法论转向:从逐件检索转到整房联合优化,并且把测试时训练用在推理阶段(冻结大模型、只调当前房间的 logits),成本可控。马氏距离对欧氏距离那一刀也值得记住:在风格这种有的维度强约束、有的维度无所谓的结构上,带可学方差的距离度量明显更准。从结果看,它已经把自动搭配推到接近人工水平,对室内设计自动化是实打实的进展。
作者承认最大的限制:整个流程依赖初始检索器的召回,如果正确的资产没进 top-K,后续场景级优化再也捞不回来,他们未来想用场景级反馈动态更新检索 query。还有两点:评测主依赖 GPT-4o 打分,虽然配了设计师盲评,但 R@1 这种「命中人工标注」的指标本身就假定人工搭配是唯一正解,而家具搭配有多解;推理时每个房间都要跑一轮 TTT(到 200 步),实时性如何没说清。