大家好!
我们刚刚发表了一篇研究论文,衡量了 ICP 容器内 LLM 推理的实际控制因素,其中前向传递完全在共识机制下运行,而不是通过链下工作者、预言机或证明系统。
论文:基于指令预算的链上 LLM 推理:指令预算成本模型、三元下限证据和会话成本
作者:Julien Aerni(Meotis Sàrl)、Siméon Fluck(Kaizen Corp SA)、Dustin Becker(ORIGYN 基金会)
论文及成果(MIT 代码,CC BY 4.0 数据):
https://doi.org/10.5281/zenodo.20607598
复现代码库:
https://github.com/Simlowker/instruction-bounded-inference-artifact
核心思想
在 ICP 中,解码吞吐量不像在 GPU 上那样受带宽限制,而是受限于每次更新调用 40B 的确定性指令预算,这使得推理问题转化为一个具有简单一阶定律的预算计算问题:
tok/call ≈ B / (α_eff × 2P)
其中 α_eff 是一个有效成本系数,它是软件栈的属性,而不是硬件的属性,在来自 8 个系列的 11 个现代解码器模型中,α_eff 聚集在 1.53(留一架构平均绝对百分比误差为 7.7%)。
主要结果
1. 仅软件层面就实现了 2.9 倍的差距,相同的 Qwen 2.5 0.5B Q8_0 GGUF,相同的主网容器框架,相同的 40B 容量上限:onicai 基线版本每次调用 10 tok,而我们的分支版本每次调用 29 tok,权重和边界条件完全相同,区别在于内核路径向量化(量化矩阵乘法内部循环的 SIMD 分派),该结果已通过对公开源代码进行全新重建(REPRODUCE.md,约 30 分钟 CPU 时间,无需其他 CPU 周期)进行了独立验证。
2. 矩阵乘法 (Matmul) 占解码成本的 98.7%,其他所有操作(归一化、注意力机制等)的成本均 ≤ 1.3–1.7%,我们还证明了一个小定理:元素级非结构化稀疏性会严格增加所测量整数路径的成本,一阶优化手段只有一个,那就是矩阵乘法核。
3. 基于共识机制的三进制底层,我们构建了一个自定义的 TQ2_0(2 位三进制)WASM SIMD 内核(上游 llama.cpp 中没有),并在解码路径的经验底层运行了专门训练的 TriLM 模型:在 560M 和 3.9B 数据量下,α_eff ≈ 1.00,在本地副本、13 节点 Swiss 子网和标准 ICP 主网子网之间,无论构建版本如何,也无论权重转换流程如何,输出结果都完全相同。
4. 会话可以进行分析性预算,多调用有状态会话的 I/O 开销是可预测的两阶段 I/O 开销(键值缓存保存/加载),与缓存大小呈线性关系(负载扫描的 R² 为 0.9998),在瑞士子网上,采用 13 节点共识机制运行了一个 10 轮聊天演示。
5. 检索功能与该机制非常契合,EmbeddingGemma-300M Q4_0 完全链上运行,每次调用大约需要 126 个输入代币,批量编码可以分摊单个代币解码无法分摊的按权重计算的负载。
为什么这对 IC 很重要?
由此得出的实用方案是:选择质量模型(目前是绑定约束),根据指令律选择参数数量和量化方式,优化矩阵乘法内核,并将保存的会话状态视为预算的一部分。
有趣的是,40B 的预算甚至不是当前规模下的实际部署上限,WebAssembly 堆和页面访问限制才是(本文包含 IC0524 / IC0502 的特性分析)。
这里没有任何需要信任的地方,每个承重数据都对应工件中一个已命名的 CSV 行,叉间隙重建完全由脚本控制。
我很乐意回答关于方法论、瑞士子网运行、三元内核或其他任何问题,非常欢迎反馈和反驳,代码库中的论点与证据矩阵正是为此而设计的。
更多相关讨论:
https://forum.dfinity.org/t/on-chain-llm-inference-under-instruction-budgets-measured-live-on-icp-mainnet/74709
#DFINITY #ICP 你关心的 IC 内容
技术进展 | 项目信息 | 全球活动
收藏关注 IC 币安频道
掌握最新资讯