RHEA:能在 RTX 5070 笔记本上训练的 1B 事件驱动架构
zemondza · reddit · 2026-08-24
作者作为独立开发者,分享了一种名为 RHEA 的新型神经网络架构实验。
核心特点:
- 事件驱动:基于事件驱动响应,而非传统的 Transformer 堆栈。
- 非标准结构:不依赖标准的 Attention/MLP 模块,尝试不同的内部处理方法。
- 消费级硬件友好:目前的优化使得可以在 RTX 5070 Laptop GPU (8GB VRAM) 上训练约 10 亿参数 的模型。
实验目标:
- 探索在没有大算力集群的情况下,此类架构能走多远。
- 研究训练行为、效率和扩展特性。
目前处于研究阶段,旨在观察模型变大时事件驱动方法的表现。
所属事件:新架构 RHEA:8GB 显存可训练 10 亿参数模型(2 条相关)→
「Infra」频道最新
- 开源方案 RobotSoul:为 Agent 提供上下文重置后的持久身份 — robauto-dot-ai · 2026-08-24
- 将 MoE 模型卸载至 RAM 运行会遭遇极慢的 Prefill — former_farmer · 2026-08-24
- Etched获10亿美元融资,Jane Street领投验证专用芯片 — TheTuringPost · 2026-08-24
- ConvRot 量化方法入驻 llama-cpp,Q6 接近 Q8 精度 — giveen · 2026-08-24
- LifeOS:基于本地模型的语音驱动个人管理工具 — Extension-Bid-639 · 2026-08-24
- 超算中心硬件选型:SSD与HDD的密度权衡 — generativist · 2026-08-24