DeepSeek发布了一篇新论文,介绍了一种名为流形约束超连接(mHC)的新架构。该架构旨在解决超连接网络(HC)技术在训练过程中出现的不稳定性和可扩展性受限的问题。通过将HC的残差连接空间映射到特定流形上,mHC恢复了恒等映射特性,并结合基础设施优化确保了效率。这使得mHC在性能和可扩展性方面有了显著提升。DeepSeek认为,mHC作为HC的一种灵活实用的拓展,不仅有助于更深入地理解拓扑架构设计,还为基座模型的发展提供了新的方向。这篇论文由解振达、韦毅轩和曹桓奇共同担任第一作者,梁文锋也是作者之一。







