Relaxing chain rule yields new divergence; Tilted ERM improves generalization
burny_tech · x · 2026-08-20
Sharing two theoretical insights:
- Relaxing the chain rule leads to a parametric divergence parameterized by a single tilt parameter.
- Replacing KL divergence (cross entropy loss) in ERM with a tilted version (Tilted ERM) yields improved generalization against train/test mismatch.
More from Research
- New Disaggregation for Hybrid Linear Models on Cerebras CS-4 — AccBalanced · 2026-08-20
- DeepSeek-R1: Incentivizing Reasoning in LLMs via Reinforcement Learning — natanielruizg · 2026-08-20
- Study Uses LLMs to Reveal Caste and Class Bias in Elite Hiring — soumitrashukla9 · 2026-08-20
- Moderna's AI-assisted mRNA cancer treatment succeeds in Phase 3 trial — KyeGomezB · 2026-08-20
- GLM-5.3 Agent Test Sees DeepSeek-V4-Pro Rage-Quit Kill Boss in ToME4 — karminski3 · 2026-08-20
- MIT Study: Generated Images Often Can't Be Traced to Training Data — Warm_Ad1257 · 2026-08-20