不重跑一遍,也能查别人的训练
这是对一篇长文的浓缩阅读,主题是去中心化的神经合成。我们不按章节走,只拆开其中一件结构:对陌生显卡的信任,在这里并非系于一招,而是分作三道防线,每道各答一个问题。把它们混作一谈,过高的期待就是从那里开始的。
一切由之而来的那种不对称
在分散计算里,核对结果的花费通常与算出结果相当。想确认某个节点真的跑过梯度、而不是吐出一堆随便凑的数,核对者就得把整趟跑一遍——把活分出去所换来的好处,也在同一瞬间蒸发干净。
这件事在历史上为何要紧,原文开篇讲得清楚:训练大网络曾是少数几家公司的特权,它们握着集中式的超算,而控制权是跟着硬件一起走的——权重被审查、意识形态上的限制、成果归谁所有。CODE 给出的回答叫去中心化神经合成,它把成千上万个各自独立的节点,也就是训练矿工,聚成一张联邦学习的网。
两个太容易混为一谈的问题
问题其一:所声称的那笔计算做没做,做得对不对。问题其二:交上来的这一块究竟有没有用,节点会不会顺手往模型里塞了后门。这是两个问题,各由两套机械对付,而证明只回答前一个。
防守的形状因此才是这样。数学抓算术上的谎,聚合的统计抓内容上的破坏,经济让这两件事都不划算。三道里抽掉任何一道,剩下两道都补不上那一段。
第一道:一步的证明
训练节点在一批数据上把权重从 `Wₜ` 推到 `Wₜ₊₁` 之后,会拼出一个 zk-SNARK `πₜᵣₐᵢₙ`,它断言三件事。向前那一趟算得没错:各层激活确实是 `Y = f(Wₜ · X + B)`。向后那一趟严格照着误差传播的规矩走。新权重服从优化器的公式,`Wₜ₊₁ = Wₜ − η · Update(∇ W)`,不论用的是 Adam 还是 SGD。
好处恰恰落在核验的时间上:Solana 的验证者只要几毫秒去看一份短短的证明,而这份证明背后压着别人显卡好几个钟头的活。整套构造,就是为了这道落差而搭的。
被拆成等式的 ReLU
在电路里,非线性从来不是一个函数,而是一组约束。一层写作 `aₗ₊₁ = σ(Wₗ · aₗ + bₗ)`,而整流器的那个 σ,靠一个二元选择位 `s ∈ {0, 1}` 和三个条件进场:`y · (1 − s) = 0`、`(x − y) · s = 0`、`y ≥ 0`。至于向后那一趟,电路要证明乘积之和 `∂L/∂wⱼₖ = Σᵢ δⱼ · aₖ` 是老老实实在整批数据上累起来的,发出去之前再想动一下梯度,已经没有余地。
为什么每个数都要乘十亿
方案所在的域是有限的:BN254 曲线的阶大约 `2²⁵⁴`。那里没有小数,于是矩阵元素统统按 `10⁹` 放大,乘积立刻落到 `10¹⁸` 的量级上。为了不让位宽错位,每个中间量都带一条范围约束 `z < 2⁶⁴`,由 64 位选择位撑着;回头那一步则用带余除法核对:`ȳᵢ = qᵢ · 10⁹ + rᵢ`,且 `rᵢ < 10⁹`。顺带的好处比主要的还重——结果不再取决于它是在哪块加速卡上算出来的。
第二道:别人的活怎么加起来
几百份本地更新要并成一个模型,用的是围着声誉改写过的联邦平均:`W_global = Σᵢ (Rᵢ / Σ Rⱼ) · Wᵢ`,其中 `Rᵢ` 随往轮的准确度和锁仓的多少而涨。谁来做这次加法,事先谁也不知道:聚合者由一个可验证随机函数抽出,而合并得对不对,另有一份 `π_merge` 作证。
模型投毒也正是在这里被逮住——那恰恰是一步的证明从原理上就看不见的东西。只要拜占庭节点少于总数的三分之一,`f < n/3`,收敛就还站得住。其上再跑一层几何中位数:离多数更新的质心太远的那个向量,在平均里直接拿到零权重,发出它的那个节点,锁着的质押由合约没收。
第三道:钱
一场训练活动以锁定 $GALATIN 预算开场,整条资金流走那条经典的 5/5/15/7/3/65 路由。百分之五烧掉,百分之五进 Maksim Valentinovich Galatin 基金的研究池,15/7/3 归三个层级的大使,剩下 65% 由出租算力的训练矿工、交出自己认知印记的用户,以及证明的验证者分掉。
这 65% 里有一半留在托管里,要等聚合那一轮被确认才放。若查出某个节点交的是错的权重或伪造的证明,罚没随即启动:地址进 `did:code` 主权注册表的黑名单,锁着的质押整份划给保险基金,活动没花掉的预算退还给发起方。
可核验这件事本身要花多少
对证明者来说最贵的一项是多标量乘法,能占去它八成的工作时间。窗口大小固定的 Pippenger 方法,通常取 `c ≈ 4`,把椭圆曲线上的点加次数削掉 75%。此后各层的局部证明用 Nova 或 Halo2 里的折叠打包起来,那里的约束数并不随层数一起长,链上要核的只有模型最后那个压缩过的多项式哈希。
开发网的实测呈笔直的线性。512 个神经元的一层要 1.2 秒、节点 16 GB 内存,证明 45 KB。宽度翻倍,一切跟着翻倍:1024 个神经元是 2.4 秒、32 GB、90 KB;2048 是 4.8 秒、64 GB、180 KB;4096 是 9.6 秒、128 GB、360 KB。
开发网测出了什么,又是用什么措辞
截至 2026 年 3 月 5 日的成绩:250 个活跃的训练 GPU 节点,跑在 Nvidia A100 与 H100 上;受训模型是 Llama-3-8B-Instruct;批量为 32 时,拼一步的证明约 4.5 秒;链上核验 210 000 个计算单元。关于准确率的那一行,原文写得很克制:在模拟中,虚假权重被拦下了。
日程占了一周多一点。2 月 27 日铺开一百个 H100 节点,启动基础协调。3 月 1 日模拟投毒:十五个节点送来伪造的更新,在那次模拟里核验方案把这些企图统统挡回,攻击者的质押被烧。3 月 3 日在一份医学数据集上训练 Llama-3-8B-Instruct,把权重合并压到每轮三分钟。3 月 5 日接上 Solana Devnet,取下最终数值。
隐私靠的是动作的次序,而不是一句承诺:基础权重下到用户的设备或者一台受保护的本地节点,更新与梯度就地用会话密钥加密,外部验证者看到的只是「这笔计算没错」这一事实,从不接触数据集本身。节点之间的流量走 p2p,由 Noise 加密。
还留着的那些保留意见
训练开销比中心化超大规模云商低约八成的那个数字,原文的说法是算力公开竞价的目标估算,而不是实测。路线图同样被称作计划:2026 年 6 月,消费级设备上的移动蜂群;9 月,横跨 Solana、以太坊与 Cosmos 的跨链模型市场;12 月,模型自行发起活动的持续自我进修。文章见刊时,三个阶段一个都还没走完。
还有一条最要紧的限制,直接从第一道防线的做法里长出来。证明作证的是算术,不是数据的价值:某个节点在一份没用的数据集上老老实实算了梯度,照样能拿到无可挑剔的 `πₜᵣₐᵢₙ`,因为原始数据压根不给验证者看。正因如此,第一道之后才还立着两道;也正因如此,硬件门槛定得很硬:不低于带 24 GB 显存的 Nvidia RTX 4090、16 个 3.5 GHz 起步的物理核心、64 GB 内存,以及 100 Mbit/s 起的对称通道。
原始出处
全文约需十二分钟阅读:企业集群与分布式算力市场的对照、固定梯度步骤的 TypeScript 代码、登记聚合权重与发放报酬的 Anchor 程序、带 VRF 签名的轮次结构、支持 Green AI 的能耗论证,以及 KCE 在轮次排程中的职责。