用户8679用户8679层 | 公开事实 | 不能顺手推断 |
基座 | Kimi K3,2.8T 总参数、104B 激活参数的开放权重模型 | Tenet 与公开 K3 checkpoint 等价 |
领域后训练 | 法律任务环境、GSPO、rank-64 LoRA、合成/公开/专家数据 | adapter 或完整 checkpoint 已公开 |
Agent 执行层 | 沙箱工作区、文件搜索/读取/写作工具,并带 Harness 改进 | 分数提升全部来自权重 |
评测 | LAB、LAB Contracts、APEX Agents、Redline Bench 等 | 不同 Harness / judge 的榜单可直接横比 |
产品 | 部分研究能力计划逐步进入 Harvey | 今天即可自行部署 Tenet 或替代律师复核 |
证据层 | 本次看到的内容 | 可信边界 |
Harvey / 合作方声明 | Tenet 训练与 benchmark 数值、B300 数量、训练时长、成本和能力描述 | 一手披露,但多数不是本次独立复现 |
公开工件 | Harvey LAB 仓库、当前 Harness / judge / sandbox 源码;Kimi K3 模型卡与完整权重 | 能审计合同,不能恢复 Tenet checkpoint |
本地静态验证 | 固定 LAB commit 7be41d57…;25 / 25 来源与合同断言;范围内 131 tests passed、59 skipped | 未下载任务语料,排除了 task-integrity / discovery 测试 |
教学探针 | 10 / 10 检查 all-pass、criterion rate、评测 manifest 与总 token 成本账本 | 不是 Tenet、LAB、GPU、法律质量或成本复现 |
公开训练参数 | 数值 / 做法 | 工程含义 |
可训练参数 | rank-64 LoRA,覆盖 attention、MLP 与 routed-expert weights,约 500k expert tensors | 不是只调最后几层的轻量 prompt tuning |
优化批次 | 每 step 为 8 个 task groups × 每组 8 rollouts | 组内相对比较构成训练信号 |
训练环境 | 约 1,750 个 Agent 法律任务环境 | 任务多样性是能力边界的一部分 |
每 epoch | 150 optimizer steps,超过 10,000 个独立 rollouts | 运行时与评分成本不可忽略 |
算力 | 约 150 张 NVIDIA B300,持续 2 个月 | 这是供应商披露,不是本次计量结果 |