
awesome-autoresearch111个自主改进循环工具、AI研究智能体与自编码智能体终极清单【免费下载链接】awesome-autoresearchA curated list of autonomous improvement loops, research agents, and autoresearch-style systems inspired by Karpathys autoresearch.项目地址: https://gitcode.com/gh_mirrors/aw/awesome-autoresearchawesome-autoresearch是一份精选索引收录了111 个自主改进循环工具、AI研究智能体与自编码智能体项目全部受 Andrej Karpathy 的 autoresearch 启发。每条条目都经过人工筛选帮你在几分钟内挑到最适合自己的 AI 自主研究工具告别无效搜索。 什么是自主改进循环Autoresearch先花 30 秒搞懂核心概念后面看清单就不会迷路提出假设AI 智能体对代码/配置/提示词做一次修改运行实验自动执行训练、基准测试或业务指标采集度量评估用可量化的指标判断改动是变好还是变差保留或回滚keep-or-revert变好就保留变差就回滚进入下一轮一句话总结这个范式只要能量化就能被优化If you can measure it, you can optimize it。智能体自己改代码、自己跑实验、自己看分数循环往复越跑越强——这正是自编码智能体最纯粹的形态。️ awesome-autoresearch 清单结构一览整份清单由 6 大类别 相关资源组成目录结构见 README.md类别内容对应章节️ 通用型衍生工具可复用的自主改进循环框架与技能库README.md 研究智能体系统从文献综述到论文撰写的全流程自动研究README.md 平台移植与硬件分支macOS / MLX / Windows / WebGPU / 多卡方案README.md 领域专项适配GPU 内核、TPU、语音、交易等垂直场景README.md 评测与基准衡量 AI 智能体实验能力的 BenchmarkREADME.md 典型用例与实战记录公开的真实优化成果与复盘README.md 新手建议的阅读顺序先看类别一找框架 → 再看类别三确认硬件适配 → 最后通过类别六的真实案例判断效果上限。️ 类别一通用型衍生工具 —— 从这里起步这一类是把 autoresearch 模式做成开箱即用框架或技能Skill的项目适合快速上手recursive-improve递归自我改进框架智能体捕获执行轨迹、分析失败模式并做针对性修复配合 keep-or-revert 评估autoresearch-anything把循环泛化到任何可度量指标——提示词、API 性能、落地页、SQL 查询、配置调参都能跑goal-md提出GOAL.md模式——智能体必须先构造一个可度量的适应度函数才能开始优化lazy-developer按优先级串起多个优化目标覆盖率、测试速度、构建速度、复杂度、性能支持 Ralph Mode 多实例并行ADASICLR 2025元智能体用代码发明新的智能体架构GEPAICLR 2026 Oral基于自然语言反思的提示词进化优化效果超过强化学习基线SICA / HGM自编码智能体经典——智能体直接编辑自己的代码库并验证提升 类别二AI研究智能体系统 —— 从想法到论文如果你想看AI 科学家的完整形态这一类最震撼AI-Scientist / AI-Scientist-v2SakanaAI首个全自动科学发现系统从想法生成到论文撰写v2 用智能体树搜索摆脱模板依赖ARKAutomatic Research Kit想法 目标会议 → 论文流水线6 个智能体协作完成提案分析、文献检索、实验、LaTeX 撰写与迭代评审ML-Agent用强化学习训练 LLM 智能体做自主机器学习工程从试错中持续变强CORAL长时运行多智能体进化系统共享持久记忆 异步执行在 10 类数学/算法任务上达到 SOTAAgentRxiv多个智能体实验室共享一个预印本服务器在彼此成果上迭代研究 类别三平台移植与硬件分支 —— 用你自己的硬件跑不想租 H100这一类让你零成本或低成本跑起自主改进循环autoresearch-macosmacOS 社区最流行的分支适配 Apple Silicon / MPSautoresearch-mlxMLX 原生移植彻底移除 PyTorch/CUDA 依赖autoresearch-win-rtx面向 Windows 消费级 NVIDIA 显卡带显存下限与桌面端部署路径autoresearch-webgpu直接在浏览器里生成训练代码、跑实验、回传结果n-autoresearch多 GPU 基础设施结构化实验追踪 崩溃恢复Colab / Kaggle T4 移植免费 T4 GPU零本地配置即可运行 类别四领域专项适配 —— 垂直场景的自主优化同样的循环换个指标就能迁移到完全不同的领域autokernelGPU 内核优化——剖析瓶颈、改一个内核、基准测试、保留或回滚tpu_performance_autoresearch_wikiTPU 模型性能MFU / tokens-per-sec优化含 Llama3-8B 与 Qwen3-8B 案例atlas-gic交易智能体以滚动夏普比率而非模型损失作为优化目标autoresearch-genealogy把循环用于家谱研究迭代扩展并核验家族史资料autospec读自然语言业务规则自动构建带测试的 Spring Boot 服务5 个周期从 119 行扩展到 950 行autoresearch-sudokuRust 数独求解器在循环中持续重写最终在困难基准上击败人工编写的主流求解器 类别五评测基准 —— 如何量化智能体能力跑循环之前先知道怎么考AI 智能体MLAgentBench13 个 ML 实验任务CIFAR-10 到 BabyLMmle-benchOpenAI衡量 AI 智能体机器学习工程能力mlrbench201 个来自 NeurIPS/ICLR/ICML 研讨会的开放任务AgentBenchICLR 20248 种环境的综合 LLM 智能体评测 类别六典型用例 —— 真实效果有多强Shopify Liquid 引擎优化Shopify CEO Tobi Lütke 公开分享的 autoresearch 式运行解析/渲染大幅提速GPUMode eigh 内核竞赛一个半自主系统两周跑了1,293 个实验比 torch 快8.56 倍拿下第三名并详细复盘了抓到的 reward hacking100 个 ML 实验过夜完成一次通宵的自主实验跑满百个实验Vesuvius Challenge 古卷墨迹检测多智能体实验循环用于古代羊皮卷 OCR跨卷泛化显著提升⚠️反面教材网球 XGBoost 预测项目公开记录了优化目标设置失误导致的钻空子行为——提醒我们度量函数设计比循环本身更重要 如何快速上手 awesome-autoresearch3 步指南第 1 步克隆仓库到本地git clone https://gitcode.com/gh_mirrors/aw/awesome-autoresearch第 2 步打开 README.md 按需求选类别想搭自编码智能体工作流 → 类别一只有 Mac 或消费级显卡 → 类别三做科研想自动写论文 → 类别二验证智能体能力 → 类别五第 3 步贡献新条目发现符合条件的项目阅读 CONTRIBUTING.md按推荐格式提交 PR 即可。该清单是精选curated而非穷举——只有明确受 autoresearch 启发或直接复用其循环的项目才会被收录。 许可协议自由使用无负担本清单采用CC0-1.0协议发布见 LICENSE已进入公共领域你可以自由复制、修改、分发甚至商用无需任何授权。小结awesome-autoresearch 是当前自主改进循环 AI 研究智能体 自编码智能体领域最完整的导航清单。收藏它你的下一次 AI 自主优化实验只需要一次复制粘贴的距离。【免费下载链接】awesome-autoresearchA curated list of autonomous improvement loops, research agents, and autoresearch-style systems inspired by Karpathys autoresearch.项目地址: https://gitcode.com/gh_mirrors/aw/awesome-autoresearch创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考