ARTICLE · INTELLIGENCE

战地情报 · 详情页

来自尧图项目组的一线实战观察与深度解析

little-coder官方榜单成绩单:Terminal-Bench 2.0达24.6%、GAIA达40%,全靠一块8GB笔记本显卡

little-coder官方榜单成绩单:Terminal-Bench 2.0达24.6%、GAIA达40%,全靠一块8GB笔记本显卡 little-coder官方榜单成绩单Terminal-Bench 2.0达24.6%、GAIA达40%全靠一块8GB笔记本显卡【免费下载链接】little-coderA harness optimized to smaller LLMs项目地址: https://gitcode.com/gh_mirrors/li/little-coderlittle-coder 是一款专为本地小模型优化的 AI 编码智能体coding agent脚手架。它的官方成绩单相当硬核在 Terminal-Bench 2.0 官方榜单拿到24.6%第120名、GAIA 验证集40.0%——而全部测试只跑在一块8GB 显存的笔记本显卡上零云端推理。下面带你拆解这份成绩单背后的硬件配置、榜单数据与核心机制。一张表看懂 little-coder 的基准测试成绩 little-coder 的四基准基线成绩同一台消费级笔记本i9-14900HX 32GB 内存 RTX 5070 Laptop 8GB 显存版本模型基准测试成绩v0.0.2Qwen3.5-9BAider Polyglot225 题45.56%v0.0.5Qwen3.6-35B-A3BAider Polyglot78.67%v0.1.4Qwen3.6-35B-A3BTerminal-Bench-Core v0.1.180 任务40.0%6小时50分跑完v0.1.13Qwen3.6-35B-A3BTerminal-Bench 2.089 任务 × 5 次 445 试24.6% ± 3.2官方榜单位120v0.1.24Qwen3.5-9BTerminal-Bench 2.09.2% ± 2.4官方榜单位142v0.1.27Qwen3.6-35B-A3BGAIA 验证集165 任务40.00%66/165四个基准覆盖了从短编码练习到交互式终端调试再到多工具在线研究的完整光谱且全部离线完成。8GB 显卡跑 22GB 大模型显存分配是核心技巧这套成绩单最反直觉的一点模型是Qwen3.6-35B-A3B——一个 35B 总参数 / 3B 激活的 MoE 模型Q4 量化后磁盘上约 22.1 GB比 8GB 显存大得多。 秘密在于 llama.cpp 的--n-cpu-moe 999参数专家权重experts放内存RAM只有注意力层和共享专家驻留显存32K 上下文下实测显存占用仅3.8 GB还留有约 4GB 余量配合--flash-attn on实测生成速度约44 tokens/s足以支撑数小时的长任务。换句话说8GB 显卡跑的是35B 模型靠的是 MoE 结构 权重分层的巧妙调度。完整的本地模型服务配置llama.cpp / Ollama / LM Studio 三种方式见 README.md 的 Local model setup 章节模型注册表在 models.json。Terminal-Bench 2.0 官方榜单24.6% 是怎么拿下的 Terminal-Bench 2.0 是目前终端智能体领域最严格的公开榜单之一89 个真实系统任务每个任务跑 5 次共 445 个试验要求提示词全程一致才能提交。little-coder 的提交路径v0.1.13全量跑完 445 个试验提交官方榜单期间发现某任务prove-plus-commCoq 交换律证明出现死亡循环式回归v0.1.24 引入提示词重复机制重新注入工具描述 简洁性指南后试点 4/4 通过榜单按 5 次试验重算后最终定格24.6% ± 3.2位列第 120 名。同期用更小的 Qwen3.5-9B5.3GB 全 GPU 部署单 token 速度快约 2 倍跑同一榜单拿到9.2% ± 2.4第142名——能力差距真实存在但远小于直觉中9B vs 35B的鸿沟。此前在 Terminal-Bench-Core v0.1.180 个任务、单次尝试上little-coder 已拿下40.0%完整复盘见 docs/benchmark-terminal-bench-v0.1.1.md。榜单提交所用的 2.0 适配器在 benchmarks/harbor_adapter/little_coder_agent.py。GAIA 基准测试 40%本地智能体做多工具研究任务GAIA 考的不是写代码而是像研究员一样工作浏览网页、抽取证据、多轮工具调用后给出准确答案。little-coder 在 165 题验证集上答对 66 题40.00%分级表现级别通过率说明L160.4%单步工具任务本地小模型已很能打L237.2%多步推理 工具组合L37.7%长程规划仍是小模型的天花板GAIA 跑法有一个关键设计工具白名单——只开放Read/Bash/Grep/Glob/WebFetch/Browser*/Evidence*刻意屏蔽Write/Edit因为研究任务不需要改代码收窄工具面能显著降低小模型的出错率。评分器忠实还原官方判分逻辑运行入口在 benchmarks/gaia.py。配套技能卡如先取证再作答协议 skills/protocols/cite_before_answer.md让模型学会把网页原文先蒸馏成证据条目避免原始文本污染上下文。成绩从哪来脚手架与模型的匹配才是关键为什么同一块 8GB 显卡上的 9.7B 小模型能拿到这些分数核心结论是脚手架–模型匹配scaffold–model fit比换更大的模型更重要。官方做的同模型对照实验最有说服力Qwen3.5-9B 用原生 Aider 只有19.11%换到 little-coder 脚手架后跳到45.6%——同样的模型权重、同样的测试协议唯一的变量是架构。矩阵里那个蓝色的69就是脚手架红利这 69 道题模型明明有能力做对原生 Aider 做不到little-coder 做到了而反向仅 Aider 通过只有 11 题约 6:1 的净增益比。little-coder pi 智能体内核 30 余个 TypeScript 扩展30 张技能卡按需注入不占冷启动上下文。对新手来说几个最承重的机制Write 守卫对已存在的文件拒绝 Write强制走 Edit杜绝小模型整文件重写翻车读后必改Edit 前必须先 Read 该文件保证编辑匹配文件当前文本质量监控检测空输出/幻觉/死循环并自动发起纠正追问思维预算每回合思考 token 上限防止小模型想跑飞技能注入按错误恢复 最近使用 意图为当前回合挑选工具卡与算法速查表如 skills/knowledge/binary_search.md。在 Aider Polyglot 的 78.67% 高分运行中各语言表现JavaScript89.8%、Python88.2%、C84.6%、Java76.6%、Go74.4%、Rust53.3%——每种语言都比 9B 模型提升 23 个百分点以上。重试机制把测试输出作为上下文再来一轮在 C 上额外挽回13.5pp、Go 上10.3pp——测试输出引导的重试是小模型脚手架的又一杠杆。时间维度上little-coder 通过一题平均176 秒Aider 141 秒但失败题上愿意多探索491s vs 224s——探索更长换来每小时 1.72 倍的通过量。little-coder 安装与本地模型配置步骤✅ 上手只需三步要求 Node.js 22.19# 1. 一键安装 npm install -g little-coder # 2. 本地起模型服务llama.cpp显存技巧见上文 --n-cpu-moe build/bin/llama-server -m ~/models/Qwen3.6-35B-A3B-UD-Q4_K_M.gguf \ --host 127.0.0.1 --port 8888 --jinja -ngl 99 --n-cpu-moe 999 --flash-attn on # 3. 在你的项目目录里启动 little-coder想复现榜单成绩或研究扩展机制可以克隆源码git clone https://gitcode.com/gh_mirrors/li/little-coder cd little-coder npm install基准测试脚本在 benchmarks/ 下Polyglot 驱动 benchmarks/aider_polyglot.py扩展系统详解见 docs/extensions.md。写在最后这份8GB 显卡成绩单传递的信号很清晰小模型 好脚手架可以打到官方榜单的中游水位而且全程免费、离线、隐私可控。little-coder 的项目路线图显示第二阶段将聚焦让本地小模型可靠地运维大型 Markdown 知识库这一日常真实场景——对一个只装在你的笔记本上的 AI 编码智能体来说这或许比榜单分数更实用。项目采用 Apache 2.0 许可证见 LICENSE欢迎直接上手。【免费下载链接】little-coderA harness optimized to smaller LLMs项目地址: https://gitcode.com/gh_mirrors/li/little-coder创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
RELATED READING

延伸阅读

更多一线实战笔记与深度复盘,助您持续精进