返回官网
AutoMind 使用手册
This manual is currently available in Chinese only. The rest of the site is fully bilingual.

AutoMind 使用手册

会自己动手干活的 AI 智能体平台 — 零基础入门 · 功能深度解读 · 场景指南
版本 v1.6.3 🏷 社区版 / 专业版 / 企业版 🖥 本地运行 · 数据不上传 🛡 全程审批与审计 🧠 10+ 模型提供商
🏷 版本体系 — 开源部分为社区版(MIT 免费):对话/工作/编程三模式与全部工具、技能、MCP、记忆、安全能力。 🤝 协同、🔁 循环、⏰ 定时任务、📊 高级统计、⭐ 自定义模板、📄 审计导出 PDF专业版👥 多用户会话池、🔐 SSO/LDAP、🧩 RBAC 权限、🚪 私有模型网关企业版 — 由商业扩展包 automind-pro 提供,配置许可证(AUTOMIND_LICENSE)后自动激活; 社区版对应入口显示 🔒。安全能力(鉴权/限流/脱敏/审计)不设付费墙。详见 docs/EDITIONS.md
🖥 v1.2 桌面版 — Windows 安装包双击即用:独立窗口(WebView2)+ 系统托盘 + 内嵌服务,无需 Python 环境与命令行; 关窗最小化到托盘,任务与定时任务继续运行;数据存放于 %APPDATA%\AutoMind(托盘菜单一键打开)。 自行构建见仓库 desktop/README.md
🎉 v1.0 正式版四大升级🖥 界面全面重构(React 18 + TypeScript + Ant Design,全部功能与操作位置不变)· 📚 RAG 知识库(上传 PDF/Word/MD/TXT,对话自动检索引用;社区版 5 文档/10MB, 专业版无限文档/200MB/多库/Reranker/引用溯源,企业版混合检索/热度统计/检索审计/批量导入)· ⚡ 语义缓存 + 🧭 模型智能路由(专业版:相似问题秒回 + 2 级路由;企业版:高级缓存 + N 级路由 + 💰 成本仪表盘)· 📏 版本限额(社区版每日任务 100 次 / 工作区 3 个;专业版任务不限 / 工作区 30 个;企业版全部不限)。
🏢 v0.8 商业功能扩容 — 专业版新增 ⭐ 自定义模板📄 审计报告导出 PDF; 企业版新增 🔐 SSO/LDAP 单点登录🧩 细粒度权限 RBAC🚪 私有模型网关。 社区版功能不减,对应入口显示 🔒。
🚀 v0.9 三大能力📄 代码编辑器(右栏「代码」标签:文件树 + Monaco 编辑器 + Diff 预览,浏览器直接改代码,Ctrl+S 保存可撤销)· 👥 团队协作(任务分配看板 + 同事 Agent 改文件实时通知;工作区/模板/专家服务器级共享)· 🎓 专家市场(官方精选 10 个一键安装、自建专家、激活后所有任务带角色设定执行; 专业版无限创建/分享/导入导出/统计,企业版审批发布)。
✨ v0.7 体验升级🌓 浅色模式(右上角随时切换)· 🗂 工作区(多目录多上下文,任务互不污染)· 📚 模板库(内置 10 个基础模板一键开跑)· 🧭 新手引导(首次自动弹出,❓ 重看)· 💰 实时成本(Token 花费估算,可自定义单价)· 📜 历史回溯(持久化 + 查看/复制/重跑)· ▶ 中断续跑(从断点继续省 Token)· ↩️ 撤销回滚(Agent 改过的文件一键恢复)· 🔌 Agent 集成(OpenAI 兼容接口 + Continue.dev 一键配置,见左下角「⚙ 设置」菜单 → 集成)。

01产品简介

普通 AI 聊天工具只能"说";AutoMind 除了聊天,还能真正在你的电脑上执行操作: 创建文件、修改代码、运行命令、抓取网页、生成报告——并且做每件事之前先自己规划步骤, 做完自己检查结果,出错自己纠正重试

🧭
先规划再动手

大任务自动拆解为目标树,按依赖顺序逐步执行,每步验证效果

🛡️
安全可控

每次工具调用经风险评估与审批门控,高危操作必须你亲自批准

🔄
自我纠错

失败时自动分析错误、生成修正方案重试,必要时回溯调整计划

🔌
模型自由

OpenAI / Claude / DeepSeek / Kimi / 通义 / 智谱 / 豆包 / Ollama / 中转代理

🧩
三套扩展体系

技能 Skill · MCP 服务器 · 生命周期插件,随需接入你的专属能力

🏠
本地私有

配置、聊天记录、API Key 全部保存在你自己的电脑,绝不上传

它能帮你做什么?

你想做的事AutoMind 怎么帮你
问问题、写文案、翻译💬 对话模式,像聊天软件一样直接问
「帮我建一个 Python 项目」⚙️ 工作模式:自动建目录、写配置、装依赖
「修复 main.py 里的 bug」💻 编程模式:读代码 → 分析 → 改代码 → 验证
「写一份行业调研报告」🤝 协同模式:研究员 + 编写员 + 审阅员多角色协作
「持续优化代码直到测试全过」🔁 循环模式:反复"执行→检查→改进"直到达标
「每天 9 点汇总昨日日志」⏰ 定时任务:后台自动执行并记录结果

02快速上手(零基础五分钟)

1
安装

命令行执行
pip install "automind-agent[web]"

2
启动

python -m automind.server
浏览器打开 localhost:8765

3
配置模型

左下角「⚙ 设置 → API Keys」填 Key,
点「🔌 测试连接」变绿即成功

4
第一个任务

切「⚙️ 工作」模式,输入任务,
看它实时规划并执行

前提:电脑已安装 Python 3.11+(命令行输入 python --version 查看)。 服务器部署可直接 docker compose up --build

三种安装方式

方式命令适合
PyPI(推荐)pip install "automind-agent[web]";升级:pip install -U "automind-agent[web]"直接使用
GitHub 源码git clone https://github.com/yl13571844594-arch/AutoMind.gitcd AutoMindpip install -e ".[web]"改代码 / 参与贡献
本地源码目录在软件目录执行 pip install -e ".[web]"压缩包 / 网盘分发
[web] 含 Web 工作台依赖;想用 Claude / Gemini 官方 SDK 等全部后端换成 [full]。 国内提速:命令末尾加 -i https://pypi.tuna.tsinghua.edu.cn/simple

三种启动方式

方式操作适合
Windows 一键双击 launch.bat,选 [2] 自动打开浏览器最简单
命令行python -m automind.server --port 8765 → 浏览器打开 http://localhost:8765通用
Dockerdocker compose up --build服务器部署
没有任何 API Key?两个零成本方案: ① 本地 Ollama——安装后 ollama run llama3.2,无需 Key; ② 中转代理——API Keys 面板底部「自定义 OpenAI 标准接口」填入代理的 api_base、模型名和 Key。

试一试:第一个任务

# 模式切到「⚙️ 工作」,输入框输入:
在当前目录创建 hello.txt,内容为 Hello AutoMind

执行时:聊天区出现「⚙️ 执行过程」实时轨迹(计划生成 → 逐步执行 → 完成), 右侧「📋 执行计划」同步刷新每步状态(○ 待执行 → ◐ 执行中 → ✓ 完成), 完成后项目目录里 hello.txt 真实存在。

03界面总览

⬢ AutoMind 工作区 💬 对话工作台 📋 计划视图 🔧 工具面板 系统 📈 观测中心 📊 统计分析 ⏰ 定时任务 📜 任务历史 🛡️ 安全审计 💬对话 ⚙️工作 💻编程 🤝协同 🔁循环 ⚡ 自动 ▾ deepseek/chat ● 📚模板 ❓引导 🔄新会话 👋 欢迎使用 AutoMind 通用自动化 Agent 顶部可切换五种模式… 创建一个 FastAPI 项目,带健康检查 ⚙️ 执行过程 🧠 规划:拆解为 4 个步骤… 🔧 terminal → mkdir fastapi-demo ✓ 🔧 file_write → main.py ✓ ◐ 正在执行:pip install fastapi… 📎 🎤 输入消息,Enter 发送,Shift+Enter 换行… 📊 实时状态 步骤3 Tokens2,418 🪙 Token 用量 📋 执行计划 ✓ 创建项目目录 ✓ 编写 main.py ◐ 安装依赖 ○ 运行验证 🌐 HTML 预览 report.html → 🛡️ 审计概览 terminal allow file_write allow ① 侧边栏 ② 模式 + 审批 + 状态 ③ 观测面板
图 3-1 · 界面三区布局:① 侧边栏导航 ② 顶部控制 + 聊天工作区 ③ 右侧实时观测面板

键盘快捷键v1.4 起为完整快捷键系统

macOS 上把下表的 Ctrl 读作 。应用内按 ? 可随时调出这张表(侧栏「⚙ 设置 → ⌨ 键盘快捷键」也能打开), 内容与实际生效的按键同源,不会出现"文档写了却按不动"。

快捷键功能
Enter / Shift+Enter发送 / 换行
EscCtrl + .停止当前任务;有弹窗时先关弹窗
Ctrl + NCtrl + L新会话(清空当前模式对话,会二次确认)
Ctrl + K打开模板库
Ctrl + ,打开通用设置
Ctrl + Shift + W切换工作区
Ctrl + /光标定位到输入框
Ctrl + Shift + L切换深色 / 浅色主题
Ctrl + = / Ctrl + - / Ctrl + 0增大 / 减小 / 复位字号
?显示快捷键帮助
Ctrl + 1 ~ Ctrl + 3切换模式:对话 / 工作 / 编程
Alt + 1 ~ Alt + 4切换视图:对话工作台 / 计划 / 工具 / 历史
带修饰键的组合在输入框里照常生效,不会打断打字;? 这类单字符快捷键只在非输入状态生效,否则你就打不出问号了。中文输入法组词过程中不会被抢键。

界面偏好(字号 / 通知 / 动效)v1.4 新增

在「⚙ 设置 → ⚙ 通用设置 → 🎨 界面偏好」里,三项都是本机生效、立即生效、自动记住, 不改变任何功能,也不会同步到别的机器。

项目说明
字号85% ~ 130% 无级调节,界面整体等比缩放(含 antd 组件)。也可用 Ctrl + = / Ctrl + - / Ctrl + 0
任务完成通知任务跑完发系统通知,只在窗口不可见时提醒; 点通知直接跳回应用。解决"发个 5 分钟的任务切走干别的,回来才发现早跑完了"
减少动效关闭淡入等动画,老机器上更跟手;系统级「减少动态效果」也会被自动尊重
关于通知权限:首次勾选时浏览器/系统会询问授权,必须允许才会收到提醒。 若曾误点"拒绝",需先到浏览器或系统的通知设置里放行 AutoMind,再回来重新勾选。桌面版直接使用系统通知中心。
会话隔离:五种模式的聊天内容互相独立,切换模式不丢各自记录; 每个浏览器也持有独立会话 ID,多人共用一台服务互不可见。

04五种交互模式深度解读

模式决定了 AutoMind「怎么思考、要不要动手、如何收尾」。选对模式,事半功倍。

💬 对话模式 —— "问答专家"

原理:纯多轮对话直连大模型,不调用任何工具,响应最快。支持图片输入(需视觉模型如 gpt-4o / qwen-vl)。

知识问答文案 / 翻译 / 润色头脑风暴看图提问 / 读报错截图
不适合:需要操作文件/命令的任务——它在此模式下没有"手",请切工作或编程模式。

⚙️ 工作模式 —— "项目经理 + 执行团队"(Plan-and-Execute)

① 分层规划 任务拆成目标树 ② 依赖排序 先建目录再写文件 ③ 逐步执行 工具调用过审批门控 ④ 符号验证 校验预期效果 ⑤ 纠错 / 回溯 失败自动修正重试 修正后重新执行该步
图 4-1 · 工作模式五步流水线
「初始化一个 FastAPI 项目,带健康检查和 Dockerfile」 「合并目录下所有 CSV 并生成汇总图表」多步骤有依赖的自动化
建议:任务描述越具体(目标目录、技术栈、验收标准),规划质量越高。 执行时盯右栏「📋 执行计划」树与聊天区「⚙️ 执行过程」轨迹即可看懂它"在想什么"。

💻 编程模式 —— "结对程序员"(ReAct 循环)

🧠 思考 下一步该做什么? 🔧 行动 读文件 / 改代码 / 跑命令 👁 观察 结果如何? 带着观察结果进入下一轮,直到判断任务完成
图 4-2 · ReAct 思考-行动-观察循环

与工作模式的区别:不预先定死计划,边做边调整——更适合"看了代码才知道下一步"的探索性任务。 思考(蓝卡)与工具调用(绿卡)全程流式展示。

「找出 main.py 启动报错的原因并修好」补类型注解 / 写测试 / 重构 代码审查
建议:先在「⚙ 设置」把项目目录指到代码仓库根——它读写以此为根,且受路径防护约束不会越界。

🤝 协同模式 —— "多角色专家组"(多智能体编排) 🔒 专业版

原理:任务分派给多个角色(规划者 / 研究员 / 编程者 / 审阅者), 各自基于共享白板完成子任务并互相看得到彼此成果,最后综合产出。

「调研三个向量数据库优劣并给选型建议」 「设计签到系统:方案 + 骨架 + 风险评估」需要多视角的复杂长任务

🔁 循环模式 —— "不达目标不罢休"(Loop Engineering) 🔒 专业版

原理:执行 → 判定"目标达成了吗" → 未达成则带着反馈继续下一轮。内置四重停止条件防死循环:

① 语义完成 模型判定任务已达标 ② 输出收敛 连续两轮相似度 > 0.95 ③ 连续空转 两轮无任何实际操作 ④ 最大轮数 兜底上限
图 4-3 · 循环模式四重停止条件
「优化到基准测试 <100ms」「修到测试全部通过」 「压缩到 500 字且保留要点」
关键技巧:任务里写清验收标准("直到测试全过"),判定器才有明确依据。可随时 ■ 中断。

模式选择决策

只是想问 / 写点东西?       → 💬 对话
让它替我做一件多步骤的事?  → ⚙️ 工作
围绕代码读改测?           → 💻 编程
复杂问题要多角度方案?      → 🤝 协同(专业版)
有明确标准要迭代到达标?    → 🔁 循环(专业版)

05工具审批与安全体系

每次工具调用都被安全体系拦截评估——你可以精确控制"它能做什么"。

工具调用请求 terminal / file_write… 风险评估 权限等级 + 动态风险分 命令预检 / 路径检查 审批门控 deny > ask > allow 按当前审批模式 放行执行 ✓ 弹窗请你批准 直接拒绝 ✗ 🛡️ 全部 记入审计
图 5-1 · 工具调用安全流水线:评估 → 门控 → 审计

三种审批模式(顶部下拉切换)

模式行为适合场景
🙋 询问除只读操作外,每次工具调用都弹窗请你批准首次使用 / 重要项目 / 想完全掌控
自动(默认)低风险自动放行;风险分 ≥60 的敏感操作与所有高危操作需确认日常使用最佳平衡
全批准跳过所有审批,完全自主运行沙箱环境批量任务;慎用

权限分级

等级示例处理
safe 安全读文件、列目录、git status直接放行
sensitive 敏感写文件、装依赖、git commit按审批模式处理
dangerous 高危rm -rf、sudo、强制推送必须人工批准
三重硬防护(独立于审批模式,始终生效):命令注入拦截 —— rm -rf /、fork bomb、写磁盘设备等灾难命令直接拒绝; ② 路径防护 —— 文件读写限定在项目目录内,../ 越界直接拒绝; ③ Python 沙箱 —— 代码执行仅允许白名单模块,禁止 os / subprocess。

事后追责:侧边栏「🛡️ 安全审计」记录每次调用的时间、工具、参数、决策、风险分与原因, 并汇总放行 / 询问 / 拒绝 / 高危次数。

06模型配置详解

支持的提供商(左下角 ⚙ 设置 → 🔑 API Keys)

OpenAI

gpt-4o · platform.openai.com

Anthropic Claude

claude-sonnet · console.anthropic.com

DeepSeek

deepseek-chat · 性价比之选

Kimi (Moonshot)

moonshot-v1 · platform.moonshot.cn

百炼 (通义 Qwen)

qwen-max · dashscope.aliyun.com

智谱 GLM

glm-4 · open.bigmodel.cn

豆包 Doubao

volcengine.com

Gemini / Grok

ai.google.dev · x.ai

Ollama 本地 🆓

llama3.2 · 无需 Key,本机 ollama serve

自定义中转代理:API Keys 面板底部填 api_base (如 https://api.your-proxy.com/v1)+ 默认模型 + Key, 即可对接任何 OpenAI 兼容 /v1/chat/completions 服务。 Key 只保存在本地 .automind_config.json;也支持环境变量 (OPENAI_API_KEYDEEPSEEK_API_KEY 等)。

省钱与提效:各模式专用模型

设置菜单的「🖥 模型配置」面板可为五种模式分别指定不同模型—— 对话用便宜快的 deepseek-chat,编程用强力的 claude-sonnet, 实现成本 / 能力的精准分配。未指定的模式沿用全局默认。

通用设置(左下角 ⚙ 设置 → 通用设置)

设置项说明建议
项目目录Agent 一切文件操作的根(带可视化目录浏览器)为不同项目切换对应目录,准确又安全
Temperature0–2,越低越严谨、越高越发散代码 0–0.3;创意 0.7+
最大输出 Token单次回复长度上限默认即可,长文档任务调大
排障利器「🔌 测试连接」:逐阶段验证 解析 → 连接 → 认证 → 响应, 精确告诉你 Key 失效、api_base 写错还是网络不通。

07工具面板:工具 / 技能 / MCP / 插件

侧边栏「🔧 工具面板」四个分段,对应 AutoMind 的四类可扩展能力。

AutoMind Agent 核心 🔧 工具 终端·文件·沙箱·浏览器 ✨ 技能 内置6个 + SKILL.md + .py 🔌 MCP 外部工具生态接入 🧩 插件 生命周期钩子扩展
图 7-1 · 四类能力围绕 Agent 核心:工具是"手",技能是"专家流程",MCP 接生态,插件挂钩子

🔧 工具 —— Agent 的"手"

工具等级功能
terminal敏感执行命令行(装依赖、跑脚本、git)
file_read安全读取文件内容
file_write敏感创建 / 覆盖文件
file_edit敏感精确字符串替换编辑(带 diff 与回滚)
python_sandbox敏感沙箱执行 Python 片段(计算 / 数据处理)
web_fetch安全抓网页提取正文与链接
browser敏感Playwright 浏览器自动化
开关用法:每个工具卡片带开关,关掉后 Agent 就"看不到"它。 不想让它上网 → 关 web_fetchbrowser;只读分析 → 只留 file_read

✨ 技能 —— 预制的"专家流程"

内置技能功能典型指令
project_init项目脚手架(目录/pyproject/venv/git)「初始化一个新项目」
code_generator代码生成 / 补全 / 脚手架,带语法校验与自动修复「生成一个爬虫脚本」
test_runner发现并运行测试、收集失败「跑一下测试」
log_analyzer日志级别统计 / 错误样本 / 高频模式聚类「分析这个日志文件」
doc_generator从 Python 源码生成 Markdown API 文档「给 src 生成 API 文档」
dep_audit依赖审计:未固定版本 / 重复声明「检查依赖健康度」

导入自定义技能:「📁 加载目录」批量导入 SKILL.md 技能包(YAML 头 + 指令正文,无代码); 「📄 导入 .py」导入继承 AbstractSkill 的 Python 技能(模板见 examples/03-skill-development/); 「⬇️ 一键导入桌面 skills 文件夹」直接吸收技能库。

🔌 MCP —— 连接外部工具生态

MCP(Model Context Protocol)是开放协议,接入后外部服务的工具自动出现在工具列表供 Agent 调用(文件系统、数据库、搜索、地图…)。支持单个添加(stdio 本地命令 / sse URL) 或直接粘贴 Claude Desktop 格式的 {"mcpServers": {...}} 批量导入。需先 pip install mcp

🧩 插件 —— 生命周期钩子扩展

插件在任务开始 / 结束 / 解析后 / 计划后 / 出错等时机自动执行你的逻辑 (记日志、发通知、审计上报),不改动主程序。面板中「加载 / 卸载」即时生效。

# 插件目录结构
~/.automind/plugins/task-timer/
├── plugin.json     # {"name":"task-timer","version":"1.0.0","description":"…"}
└── hooks.py        # def get_hooks() -> AgentHooks
安全设计:插件内部异常会被系统吞掉,永远不会影响任务主流程。 完整示例见 examples/04-plugin-development/

08高级功能

🔄 自主任务闭环(v0.3 新增,默认开启)

工作 / 编程模式任务完成后自动执行"质检流水线",不合格自动返工—— 把"AI 说做完了"变成"验证过真的做完了"。

任务执行完成 工作 / 编程模式 🧪 TDD 测试 自动跑 pytest(编程) 🧐 多Agent审查 审阅者复核(工作) ✅ Loop 验收 语义判定是否完成 🔧 自动修复 带反馈返工 ≤2 轮 修复后重新验收
图 8-1 · 自主任务闭环流水线(各环节可在设置中单独开关)
开关(⚙ 设置 → 通用)作用何时关闭
🧐 多Agent审查工作模式完成后审阅者角色复核,可调用只读工具核实(MCP 工具共享)追求极致速度 / 省 Token
✅ Loop 验收语义验收 + 未过带反馈自动修复(≤2 轮)简单任务不需返工
🧪 TDD 测试编程模式改 .py 即时语法验证;收尾自动跑 pytest项目测试极慢时
⚡ 并行执行计划中互不依赖的步骤 asyncio.gather 并发步骤有隐式资源冲突时
📦 子任务缓存同任务内相同只读调用结果复用需每次强制重读时
编程模式 TDD 内环:每次写入/编辑 .py 后系统立即语法检查, 把 syntax_check: OK / FAILED 注入模型观察——有错它下一步就看到并立刻修复, 形成 编辑 → 验证 → 修复 闭环。另有 code_generate 工具 (语言检测、语法校验 + 自动修复、mode='complete' 代码补全)。
安全边界:并行只发生在互不依赖的步骤间;缓存只作用于 SAFE 级只读工具 (写文件、执行命令永远真实执行);审阅者只能调用只读工具。
定时任务 🔒 专业版

任务内容 + 模式(五种均可)+ 间隔(每5分钟 / 每小时 / 每6小时 / 每天)。 后台调度、结果入历史、重启自动恢复。

场景:每天汇总日志错误、每小时抓数据追加 CSV、每 6 小时跑测试。

📊
统计分析仪表盘 🔒 高级部分为专业版

四个命中率圆环(工具/计划/任务/自我修正 + 综合平均)、上下文使用率发光条、 最近 50 次趋势折线、Token 效率、记忆系统指标。

用途:评估模型效果、监控 Token 花销、发现异常任务。

🌐
HTML 预览

Agent 生成的 HTML(报告/图表/页面)出现在右栏列表,点击即在弹窗内直接渲染,免去手动找文件。

📎🎤
多模态输入

对话模式上传图片(可多张)配视觉模型看图问答;🎤 语音实时转文字输入(Web Speech API)。

👥
多用户会话隔离

每个浏览器独立会话 ID:团队共用一台服务,聊天记录互不可见、互不清除。

📚
RAG 知识库 v1.0 · 社区版起

侧边栏「📚 知识库」上传 PDF/Word/MD/TXT → 自动分段 + embedding → 对话时自动检索你的资料作答(可开关)。 社区版 5 文档/10MB;专业版无限文档/200MB/多库/Reranker/引用溯源/定时重嵌入/外部向量后端; 企业版混合检索(向量+词法)/热度统计/检索审计/目录批量导入、总量不限。

语义缓存 🔒 专业版

对话模式相似问题秒回历史答案(0 Token)。专业版基础缓存(300 条/24h), 企业版高级缓存(2000 条/7 天 + 命中率与节省统计)。「🧭 路由与成本」视图可调阈值/清空。

🧭
模型智能路由 🔒 专业版

按任务复杂度(长度/代码特征/多步骤,0~100 打分)自动分级选模型:简单问答走便宜小模型、复杂任务走强模型。 专业版 2 级路由,企业版 N 级 + 💰 成本仪表盘(按模型/日聚合成本 + 缓存节省)。

📈
观测中心 v1.3 · 社区版起

侧边栏「📈 观测中心」把 Agent 的执行过程画成实时更新的 DAG:任务 → 计划步骤 → 工具调用三层, 六种状态配色(待执行/执行中/成功/失败/回溯/已中断),点节点看耗时与失败原因。 社区版可看当前任务的实时 DAG(只读、仅当前任务); 专业版加实时看板(成功率 / P50·P95 耗时 / 工具热度 / 失败归因)、200 次运行历史回看与 JSON 导出; 企业版历史扩到 2000 次并按会话维度分组。全程本机内存构建,不额外消耗 Token。

📏
版本限额 v1.0

社区版每日任务 100 次、工作区 3 个;专业版任务不限、工作区 30 个;企业版全部不限。 顶栏 📅 徽标实时显示当日用量,超限给出友好升级提示(跨天自动清零)。

输出便捷操作

每条 AI 消息悬浮「⧉ 复制」;每个代码块带语言标签和独立复制按钮。

09命令行与 REPL

不开浏览器也能用。安装后命令行直接可用 automind 命令。

# 单次任务(默认工作模式)
automind "创建一个 requirements.txt 包含 fastapi 和 uvicorn"

# 指定模式 / 模型 / 项目目录
automind --mode react --provider deepseek -p D:\myproj "修复 main.py 的报错"

# 信息查询
automind --version        automind --list-tools
automind --list-skills    automind --list-providers

Rich REPL(交互式彩色终端)

不带参数运行 automind 进入:

┌──────────────── REPL ────────────────┐
AutoMind v1.6.3                        
模式: plan_and_execute · 模型: deepseek/…
输入任务开始,/help 查看命令           
└──────────────────────────────────────┘
automind> _
REPL 命令功能
/help帮助
/mode react · /mode plan_and_execute切换执行模式
/tools · /skills表格列出工具 / 技能
/stats本次会话任务数与 Token
/clear · /exit清屏 · 退出(带 Token 总摘要)
其他任何输入作为任务执行,结果 Markdown 面板渲染

10部署与运维(团队 / 生产)

Docker 部署

docker compose up --build
# 数据(配置/记忆/检查点)持久化在 automind_data 卷
# 镜像特性:非 root 用户、/data 工作卷、自带健康检查

生产加固环境变量(默认全关,按需开启)

变量作用建议
AUTOMIND_AUTH_TOKEN所有 API 与 WebSocket 需带 Bearer 令牌暴露公网必开
AUTOMIND_CORS_ORIGINS收紧跨域来源(逗号分隔)配合前端域名
AUTOMIND_MAX_CONCURRENT并发任务上限(默认 8,超出 429)按机器性能调
AUTOMIND_RATE_LIMIT/api/run 每客户端每分钟次数(0=关)公网建议 30
AUTOMIND_REDACT_SECRETS输出中的 API Key / 密码自动打码多人环境建议开
AUTOMIND_ALLOWED_ORIGINSWebSocket Origin 白名单防跨站劫持
运维接口:GET /api/health(免鉴权)返回版本 / 运行任务数 / 并发上限 / 运行时长,供探活与负载均衡。 安装 structlog 输出 JSON 结构化日志,未装自动降级标准格式。服务退出自动释放 MCP / 向量库 / 模型连接池。

🗄 数据与存储(v1.1:SQLite)

v1.1 起高频数据从零散 JSON 平面文件收敛到 SQLite(WAL 模式,并发安全、增量写入)。 首次启动自动把旧 JSON 数据一次性导入,旧文件原地保留作备份,升级零感知。

数据存储位置说明
任务历史 / 团队任务 / 每日限额.automind/automind.db滚动上限 200 条历史;限额跨天自动清零
对话会话(多用户隔离).automind/sessions.db每会话最近 200 条消息
知识库(文档/片段/向量/检索日志).automind/kb/kb.db片段与向量增量落库,检索走内存热路径
配置 / API Key / 工作区.automind_config.json保持纯文本 JSON(体量小、可手工编辑)
备份:停止服务后整体拷贝 .automind/ 目录与 .automind_config.json 即完成全量备份;迁移到新机器原样放回即可。 SQLite 文件可用任意 SQLite 工具(如 sqlite3 CLI、DB Browser)直接查看。

11常见问题 FAQ

顶部模型徽标一直是红色「未配置」?
还没配 API Key。左下角「⚙ 设置 → API Keys」为当前提供商填 Key 并「测试连接」。
徽标黄色带 ⚠?
有 Key 但初始化失败。常见原因:Key 失效、api_base 写错、网络不通。「测试连接」会告诉你卡在哪个阶段。
任务卡住不动 / 想中断?
点输入区 ■ 或按 Ctrl + .。循环模式还会在收敛 / 空转时自动停止。
为什么它说「文件不存在」?
检查右上角 📁 项目目录是否指向正确位置——所有相对路径以它为根,且出于安全不允许访问目录之外的文件。
担心它乱删文件?
三层保险:① 审批切「🙋 询问」逐一批准;② 高危命令(rm -rf 等)被硬拦截;③ 事后「🛡️ 安全审计」核查每次调用。
换台电脑打开,聊天记录不见了?
正常。会话按浏览器隔离(多用户设计)。记录都在服务器本地 .automind/chats/ 下。
Token 花得快怎么办?
① 设置菜单「🖥 模型配置」给对话模式配便宜模型;② 「📊 统计分析」看 Token 效率定位大户任务;③ 任务描述精准、避免反复试错。
想让它用我公司内部的工具?
三选一:写 Python 技能(最简单,见 examples/03);架 MCP 服务器(标准协议,生态互通);写插件(适合通知 / 审计等旁路逻辑)。

12附录:速查表

五种模式一句话

模式引擎一句话
💬 对话直连 LLM只聊不动手
⚙️ 工作Plan-and-Execute先列计划再逐步干
💻 编程ReAct 循环边看边改边验证
🤝 协同多智能体编排专家组分工协作
🔁 循环Loop Engineering迭代到达标为止

常用 API 端点(二次开发)

端点方法功能
/api/healthGET健康检查(免鉴权)
/api/runPOST执行任务 {task, interaction, session_id}
/wsWebSocket流式执行 + 实时事件 + 审批交互
/api/status · /api/stats/detailGET状态 · 高级统计
/api/skills · /api/mcp · /api/pluginsGET/POST三类扩展管理
/api/schedule · /api/auditGET/POST定时任务 · 审计日志

文件位置

内容位置
配置与 API Keys项目目录 .automind_config.json
聊天记录.automind/chats/<会话ID>.json
长期记忆(向量库).automind/chroma/
检查点.automind/checkpoints/
插件~/.automind/plugins/
教程示例仓库 examples/ 目录

13更新日志

每次升级带来了什么,按版本倒序。完整记录见仓库 CHANGELOG.md

v1.6.32026-08-25 当前版本
别再为看不见的东西付钱 — 修复「每步重读整本工具说明书」「压错对象的压缩」「每轮重注知识库」,长会话与长任务不再卡顿;三平台安装包同步更新到 v1.6.3
  • 🧰 ReAct 不再每步重念整本工具说明书:31 个内置工具的 schema 约 2.5 万字符(≈6k~8k token),此前每调用一步就完整下发一遍,跑 20 步就有十几万 token 花在「告诉模型它有哪些工具」上。现在按任务只下发相关的一批(默认 14 个)完整 schema,其余在系统提示里留「名字 — 一句话」目录,模型点名后再补发 —— 能力一个没少,只是不再每轮重付execution.react_tool_budget = 0 可恢复旧行为。
  • 🗜 预算告警时的「压缩」终于压在了实处:此前 80% 用量时花钱调的摘要压的是从未进入请求体的 ContextManager,白付。现在优先本地折叠 ReAct 自己的消息列表(旧的工具观察结果动辄几千字符),纯本地、不花钱,并可在用量上涨时反复触发。
  • 📚 知识库不再每轮重注一遍:此前检索片段拼在提问前发出、生成完又从历史里还原,下一轮模型看不到只好再注入一次(同一份连问五轮付五遍)。现在片段作为独立消息留在会话中并逐条去重 —— 同一段只付一次,被挤出可见窗口后自动补发;用户原话不再被改写。
  • 📡 失败不再伪装成「没有数据」:30 处静默 .catch(() => {}) 全部清理。工具面板、专家市场、定时任务、工作区、观测栏、路由与成本、知识库统计现在会分别说清「正在加载 / 加载失败(可重试,带具体原因)/ 确实一条都没有」。
  • 💬 长会话与长任务不再卡:100+ 条会话默认只渲染最近 40 条(可点「载入更早」逐批展开且视线不跳动);长回答尾部改为增量解析不再平方级卡顿;执行轨迹面板保留最近 300 条并标出折叠数量,完整过程在「任务历史」与「观测中心」照常留存。
  • 🧪 新增 20 条回归用例tests/planning/test_react_token_budget.py(工具预算挑选、休眠工具补发、压缩幂等)与 tests/server/test_kb_injection_dedupe.py(同段不重复注入、新片段照常注入、挤出窗口后补发)。
  • 📦 安装包更新到 v1.6.3:Windows(.exe,Certum 代码签名)、macOS(.dmg 通用二进制)、Linux(.deb amd64)三平台安装包已更新到 v1.6.3,SHA-256 校验值同步更新,可从官网下载区直接获取。
v1.6.02026-08-16
发布 v1.6.0 桌面安装包(Windows / macOS / Linux)
  • 📦 全新安装包:Windows(.exe)、macOS(.dmg)、Linux(.deb)三平台安装包已更新到 v1.6.0,可从官网下载区直接获取,校验值同步更新。
v1.5.02026-08-07
新增 12 个办公与集成工具 — AI 现在能直接帮你处理表格、文档、邮件
  • 📊 办公四件套Excel(读写表格、增删行、和 CSV 互转)、 Word(读取内容、生成文档、插入表格)、 PDF(提取文字、合并、拆分、旋转)、 邮件(发送邮件、收取和查看收件箱)。 直接说"把这个表格里的数据汇总成一份 Word 报告"就行。
  • 🔧 通用五件套联网搜索网页/接口请求数据库查询文件检索(按文件名或内容找)、 压缩解压(zip / tar.gz)。
  • 🤝 协同三件套桌面通知(长任务跑完弹窗提醒)、 日历(ICS 日程文件,Windows 上还能直接写进 Outlook)、 群机器人(钉钉 / 企业微信 / 飞书 / Slack)。
  • 📦 按需安装,不臃肿:办公功能依赖的库不会随主程序一起装。 桌面版已内置;用 pip 安装的用户,第一次用到时会提示一行安装命令, 照抄即可(pip install "automind-agent[office]")。
  • 🔐 外发动作一律需要你点确认:发邮件、发群消息属于「发出去就收不回」的操作, 默认每次都要经过审批。另外刻意不提供群发功能(收件人上限 20 人)—— 能被 AI 驱动的无限群发就是垃圾邮件工具,专业版同样不会解锁。 邮箱密码只从环境变量读取,不会出现在任何记录里。
  • 🛡 联网与解压的安全防护:网络请求默认禁止访问内网地址 (防止 AI 被网页内容诱导去读取你的内网服务或云端凭据); 解压会校验压缩包内的路径,防止文件被释放到目录之外。
  • ⭐ 社区版与专业版的分界:分界线划在具体动作上,不是整个工具 —— 社区版能真正把表格读出来、把报告写出去。 进阶动作(Excel 样式美化、Word 模板套打、PDF 加水印与加密、 企业数据库读写)属专业版。
v1.4.62026-08-07
堵上一条上版没能覆盖到的跨站通道 — 建议立即升级
  • 🚨 阻止外部网页通过 WebSocket 操纵本机:上一版收紧了跨站访问,但 WebSocket 走的是另一条路,不受那套规则约束 —— 也就是说,你访问的任何网页 仍可能在后台连上本机 AutoMind,让它执行任务、读写文件。现已改为 默认只接受本机页面的连接,外部来源一律拒绝并记录日志。 命令行与 SDK 调用不受影响;只在本机使用无需任何额外设置。
v1.4.52026-08-06
安全加固第二轮 — 承接 v1.4.4,建议一并升级
  • ✅ 「询问」模式的最后两个漏口:上一版只补了一处,另外两条执行路径 (编程模式的 ReAct 循环、工作模式的计划执行)仍会在没有审批通道审批出错时直接放行 —— 需要你点「批准」的操作被悄悄执行了。现已全部改为 问不到人就不做,并在界面上说明原因。
    若你希望无人值守运行,请把审批模式设为「自动」或「全批准」—— 这是明确的授权表达,而不是靠配置疏漏放权。
  • 🌐 收紧跨站访问(重要):此前的配置会让你浏览的任何网页都能在后台 调用本机 AutoMind 并读取结果 —— 包括让它执行任务。而本地默认又不开鉴权。 现在默认只信任本机页面;需要其它来源请显式配置。
  • 📁 目录浏览限定范围:选择项目目录时不再能浏览整块磁盘,只限 主目录、当前项目与已配置的工作区。实测 C:\ 下可见目录从 22 个收敛到 1 个。
  • 🔑 开放到局域网时自动开启鉴权:以 --host 0.0.0.0 启动而又没设访问令牌时, 系统会自动生成一个随机令牌并在启动信息里醒目打印(同时保存下来)。 只在本机使用则完全不受影响,无需任何额外操作。
  • 🔒 IDE 接入配置接口:该接口会返回明文访问令牌,现在未设令牌时只允许 本机读取,并禁止被缓存。
v1.4.42026-08-06
安全加固专版 — 强烈建议升级
  • 🔒 代码沙箱重写(最高危):此前 Agent 执行的「Python 代码」能跑出沙箱, 读写你机器上的任意文件、甚至执行任意系统命令。已重写为三层防御: 执行前静态检查、受限运行环境、并放到独立子进程里跑。 另外修复了「超时不生效」——死循环代码此前会把程序卡住无法恢复,现在会被真正终止。
    说明:沙箱防的是"AI 写出的代码越权",不等于可以放心执行来路不明的代码; 确有此需要请在容器/虚拟机中部署。
  • 💉 修复测试技能的命令注入:运行测试时的文件匹配参数由 AI 填写, 此前会被当成系统命令的一部分执行,构造特殊内容可执行任意命令。现在改为 参数化调用(不经过命令行解释器)并做严格字符校验。
  • ✅ 修复「询问」模式可能被静默跳过:审批通道出错时(最常见的是你关掉了页面), 系统此前会默认放行,等于「询问」模式悄悄变成了「全批准」。现在一律按 拒绝处理,并在界面上说明原因。命令行审批里「直接回车」也不再等于同意。
  • 📁 收紧目录浏览接口:此前任何人都能通过接口列举本机任意目录。 若你把服务开放到局域网又没设访问令牌,等于把磁盘目录结构公开了。现在 未设令牌时只允许本机访问,并禁止浏览系统敏感目录。本机选择项目目录不受影响。
v1.4.32026-08-05
修复输入框被挤出界面 · 任务历史可搜索 · 执行进度看得见
  • 🩹 修复长会话把输入框挤出界面:消息一多,对话面板会被内容撑破容器, 消息区不再滚动、输入框被顶到视口之外彻底看不见。实测 80 条消息时面板高度 被撑到 11821 像素(可用高度仅 648)。已修复:同样 80 条消息下消息区 正常滚动、输入框稳定停在底部。
  • 🔍 任务历史可搜索、可翻页:新增关键词搜索(任务内容与产出一起匹配, 命中处高亮)、模式筛选成功/未完成筛选;列表改为分页(每页 20 条), 不再一次性把全部记录铺出来。另外,此前界面只能看到最近 50 条,而系统实际 保留 200 条 —— 剩下的记录够不着,现在都能搜到了。
  • ⏱ 执行进度看得见:输入框上方新增一条轻量进度指示 —— 当前阶段 · 第 X / N 步 · 正在做什么 · 已耗时,右侧「查看详情」可直接跳到 观测中心看完整执行过程。解决"长任务跑着跑着,界面看起来像卡住了"。 对话与编程模式没有预先生成的计划,此时不显示编造的百分比, 改用流动条表示"正在进行、总量未知"。
v1.4.22026-08-05
消息可编辑/删除 · 断线可视化 · 恢复语义纠正 · 界面精修
  • ✎ 消息编辑与删除:把鼠标移到任意气泡上,右上角会浮出操作条 —— 复制 / 编辑 / 删除。此前发错问题只能"复制原文 → 手动改 → 重发"。 编辑用内联输入框(Enter 发送、 Esc 取消),重发时会自动移除该条及其之后的消息, 因为问题都改了、基于旧问题的回答留着只会让上下文自相矛盾。删除有二次确认, 且只影响本地会话记录,不会回滚已产生的文件改动
  • 🔌 断线时看得见"正在重连":新增顶部横幅,显示重连倒计时与已尝试 次数,并可点「立即重连」跳过等待;顶栏状态徽标区分「⟳ 重连中」与「○ 未连接」; 重连成功会给出提示。此前断线只有一个不起眼的灰色「未连接」, 用户常常是发消息没反应才发现。
  • ⚠ 任务执行中断线不再卡死:连接一断,本次执行的结果就送不回来了, 而界面此前会一直停在"执行中"、输入框永久禁用。现在会落一张失败卡片 (带重跑入口)并解锁界面。
  • 🩹 「继续此任务」改名,避免误导:经核对,本软件没有真正的断点续传—— 检查点只在任务成功结束后才写,任务失败时并不会留下检查点。所以按钮改为 「▶ 检查现状后接着做」(重发任务并要求模型先核对已完成的部分)与 「↻ 从头重跑」,并注明:两者都会重新执行一次任务,已写出的文件不会被回滚。
  • 🔢 修复升级日志里的退出码记错:可见模式重试安装成功时,安装日志却仍记录 为失败码,排查升级问题时会被带偏。现已修正。
  • 🎨 界面精修:气泡改用双层阴影、悬停轻微抬起,头像加内描边,滚动条静止时 隐入,输入区聚焦时整条底栏提亮,数字统一等宽字形;并补上全局键盘焦点环, 纯键盘操作时能看清焦点位置。
v1.4.12026-08-05
修复"点升级后应用消失" · 输入框草稿保护 · 任务失败可一键恢复
  • 🛠 修复升级后应用不再启动:桌面版是无控制台的 GUI 进程,升级脚本又以 分离方式启动,此前没有显式指定标准输入输出句柄 —— 脚本里的重定向和管道 全部失效,批处理在装之前就退出了,于是"应用退出、再也没回来"。现已修复, 并给脚本加了三重兜底:静默安装失败自动改用可见模式重试(装在 Program Files 需要 UAC 提权)、安装前清理残留实例、 无论成败最后都把应用拉起来。安装日志与执行轨迹留在临时目录便于追查。
  • ✍ 输入框草稿自动保存:打到一半切模式、切视图、关窗口,内容不再丢失, 重新打开自动回填(按会话与工作区隔离)。语音听写与模板填入的内容一并保护。
  • 🎯 打开即聚焦:进入对话区、切换模式、任务跑完后自动把光标交还输入框, 省掉"先点一下输入框"这步;有弹窗时不抢焦点。
  • ⧉ 自己发的提问也能复制:此前复制按钮只挂在 AI 回复上。同时改为复制 Markdown 原文(旧实现取气泡可见文本,会把复制按钮自己的图标一起带走), 并在非 HTTPS 环境下自动回退,局域网访问时复制不再失灵。
  • 🚑 任务失败有了恢复入口:失败/中断从"一行红字"改为一张卡片 —— 可展开完整报错、▶ 继续此任务(从中断处续跑,不重做已完成部分)、 ↻ 重新执行⧉ 复制错误,并针对 Key 失效、限流、超时、网络不通、 上下文超长等常见原因给出下一步建议。任务原文随卡片一起留存, 重启应用后依然能续跑
  • 📖 手册新增本章:更新日志现可在手册内直接查阅。
v1.4.02026-07-30
四项体验增强:字号调节 · 无闪烁切换 · 完整快捷键系统 · 任务完成通知
  • 🔤 字号调节:85%~130% 无级调节,Ctrl + = / - / 0 可直接调,"标准"档与升级前像素级一致。
  • ✨ 消除切换时的黑屏闪烁:对话面板改为常驻挂载、只切显示,DOM 不再重建, 顺带修复切回对话时滚动位置丢失;新增「减少动效」开关。
  • ⌨ 完整快捷键系统:新增 19 项全局快捷键,按 ? 查看; 帮助弹窗内容由注册表直接生成,与实际生效的按键同源。
  • 🔔 任务完成桌面通知:仅在窗口不可见时提醒,点通知跳回应用, 完成/失败/中断三种终态都会通知。
v1.3.22026-07-29
三平台安装包 · 兼容版界面补齐升级提示
  • 首个三平台同时发布的版本:Windows(代码签名)/ macOS(通用二进制 DMG)/ Linux。
  • 修复 PyPI 元数据死链与许可字段。
  • 兼容版界面补齐升级提示与检查更新入口。
💡 应用内点击左下角 「⚙ 设置 → 检查更新」 可查看是否有新版本并一键升级; 升级过程中应用会短暂退出,安装完成后自动重新启动