AutoMind 使用手册
automind-pro 提供,配置许可证(AUTOMIND_LICENSE)后自动激活;
社区版对应入口显示 🔒。安全能力(鉴权/限流/脱敏/审计)不设付费墙。详见 docs/EDITIONS.md。
%APPDATA%\AutoMind(托盘菜单一键打开)。
自行构建见仓库 desktop/README.md。
01产品简介
普通 AI 聊天工具只能"说";AutoMind 除了聊天,还能真正在你的电脑上执行操作: 创建文件、修改代码、运行命令、抓取网页、生成报告——并且做每件事之前先自己规划步骤, 做完自己检查结果,出错自己纠正重试。
大任务自动拆解为目标树,按依赖顺序逐步执行,每步验证效果
每次工具调用经风险评估与审批门控,高危操作必须你亲自批准
失败时自动分析错误、生成修正方案重试,必要时回溯调整计划
OpenAI / Claude / DeepSeek / Kimi / 通义 / 智谱 / 豆包 / Ollama / 中转代理
技能 Skill · MCP 服务器 · 生命周期插件,随需接入你的专属能力
配置、聊天记录、API Key 全部保存在你自己的电脑,绝不上传
它能帮你做什么?
| 你想做的事 | AutoMind 怎么帮你 |
|---|---|
| 问问题、写文案、翻译 | 💬 对话模式,像聊天软件一样直接问 |
| 「帮我建一个 Python 项目」 | ⚙️ 工作模式:自动建目录、写配置、装依赖 |
| 「修复 main.py 里的 bug」 | 💻 编程模式:读代码 → 分析 → 改代码 → 验证 |
| 「写一份行业调研报告」 | 🤝 协同模式:研究员 + 编写员 + 审阅员多角色协作 |
| 「持续优化代码直到测试全过」 | 🔁 循环模式:反复"执行→检查→改进"直到达标 |
| 「每天 9 点汇总昨日日志」 | ⏰ 定时任务:后台自动执行并记录结果 |
02快速上手(零基础五分钟)
命令行执行pip install "automind-agent[web]"
python -m automind.server
浏览器打开 localhost:8765
左下角「⚙ 设置 → API Keys」填 Key,
点「🔌 测试连接」变绿即成功
切「⚙️ 工作」模式,输入任务,
看它实时规划并执行
python --version 查看)。
服务器部署可直接 docker compose up --build。三种安装方式
| 方式 | 命令 | 适合 |
|---|---|---|
| PyPI(推荐) | pip install "automind-agent[web]";升级:pip install -U "automind-agent[web]" | 直接使用 |
| GitHub 源码 | git clone https://github.com/yl13571844594-arch/AutoMind.git → cd AutoMind → pip install -e ".[web]" | 改代码 / 参与贡献 |
| 本地源码目录 | 在软件目录执行 pip install -e ".[web]" | 压缩包 / 网盘分发 |
[web] 含 Web 工作台依赖;想用 Claude / Gemini 官方 SDK 等全部后端换成 [full]。
国内提速:命令末尾加 -i https://pypi.tuna.tsinghua.edu.cn/simple。三种启动方式
| 方式 | 操作 | 适合 |
|---|---|---|
| Windows 一键 | 双击 launch.bat,选 [2] 自动打开浏览器 | 最简单 |
| 命令行 | python -m automind.server --port 8765 → 浏览器打开 http://localhost:8765 | 通用 |
| Docker | docker compose up --build | 服务器部署 |
ollama run llama3.2,无需 Key;
② 中转代理——API Keys 面板底部「自定义 OpenAI 标准接口」填入代理的 api_base、模型名和 Key。试一试:第一个任务
# 模式切到「⚙️ 工作」,输入框输入:
在当前目录创建 hello.txt,内容为 Hello AutoMind
执行时:聊天区出现「⚙️ 执行过程」实时轨迹(计划生成 → 逐步执行 → 完成),
右侧「📋 执行计划」同步刷新每步状态(○ 待执行 → ◐ 执行中 → ✓ 完成),
完成后项目目录里 hello.txt 真实存在。
03界面总览
键盘快捷键v1.4 起为完整快捷键系统
macOS 上把下表的 Ctrl 读作 ⌘。应用内按 ? 可随时调出这张表(侧栏「⚙ 设置 → ⌨ 键盘快捷键」也能打开), 内容与实际生效的按键同源,不会出现"文档写了却按不动"。
| 快捷键 | 功能 |
|---|---|
| Enter / Shift+Enter | 发送 / 换行 |
| Esc 或 Ctrl + . | 停止当前任务;有弹窗时先关弹窗 |
| Ctrl + N 或 Ctrl + L | 新会话(清空当前模式对话,会二次确认) |
| Ctrl + K | 打开模板库 |
| Ctrl + , | 打开通用设置 |
| Ctrl + Shift + W | 切换工作区 |
| Ctrl + / | 光标定位到输入框 |
| Ctrl + Shift + L | 切换深色 / 浅色主题 |
| Ctrl + = / Ctrl + - / Ctrl + 0 | 增大 / 减小 / 复位字号 |
| ? | 显示快捷键帮助 |
| Ctrl + 1 ~ Ctrl + 3 | 切换模式:对话 / 工作 / 编程 |
| Alt + 1 ~ Alt + 4 | 切换视图:对话工作台 / 计划 / 工具 / 历史 |
界面偏好(字号 / 通知 / 动效)v1.4 新增
在「⚙ 设置 → ⚙ 通用设置 → 🎨 界面偏好」里,三项都是本机生效、立即生效、自动记住, 不改变任何功能,也不会同步到别的机器。
| 项目 | 说明 |
|---|---|
| 字号 | 85% ~ 130% 无级调节,界面整体等比缩放(含 antd 组件)。也可用 Ctrl + = / Ctrl + - / Ctrl + 0 |
| 任务完成通知 | 任务跑完发系统通知,只在窗口不可见时提醒; 点通知直接跳回应用。解决"发个 5 分钟的任务切走干别的,回来才发现早跑完了" |
| 减少动效 | 关闭淡入等动画,老机器上更跟手;系统级「减少动态效果」也会被自动尊重 |
04五种交互模式深度解读
模式决定了 AutoMind「怎么思考、要不要动手、如何收尾」。选对模式,事半功倍。
💬 对话模式 —— "问答专家"
原理:纯多轮对话直连大模型,不调用任何工具,响应最快。支持图片输入(需视觉模型如 gpt-4o / qwen-vl)。
⚙️ 工作模式 —— "项目经理 + 执行团队"(Plan-and-Execute)
💻 编程模式 —— "结对程序员"(ReAct 循环)
与工作模式的区别:不预先定死计划,边做边调整——更适合"看了代码才知道下一步"的探索性任务。 思考(蓝卡)与工具调用(绿卡)全程流式展示。
🤝 协同模式 —— "多角色专家组"(多智能体编排) 🔒 专业版
原理:任务分派给多个角色(规划者 / 研究员 / 编程者 / 审阅者), 各自基于共享白板完成子任务并互相看得到彼此成果,最后综合产出。
🔁 循环模式 —— "不达目标不罢休"(Loop Engineering) 🔒 专业版
原理:执行 → 判定"目标达成了吗" → 未达成则带着反馈继续下一轮。内置四重停止条件防死循环:
模式选择决策
让它替我做一件多步骤的事? → ⚙️ 工作
围绕代码读改测? → 💻 编程
复杂问题要多角度方案? → 🤝 协同(专业版)
有明确标准要迭代到达标? → 🔁 循环(专业版)
05工具审批与安全体系
每次工具调用都被安全体系拦截评估——你可以精确控制"它能做什么"。
三种审批模式(顶部下拉切换)
| 模式 | 行为 | 适合场景 |
|---|---|---|
| 🙋 询问 | 除只读操作外,每次工具调用都弹窗请你批准 | 首次使用 / 重要项目 / 想完全掌控 |
| ⚡ 自动(默认) | 低风险自动放行;风险分 ≥60 的敏感操作与所有高危操作需确认 | 日常使用最佳平衡 |
| ✅ 全批准 | 跳过所有审批,完全自主运行 | 沙箱环境批量任务;慎用 |
权限分级
| 等级 | 示例 | 处理 |
|---|---|---|
| safe 安全 | 读文件、列目录、git status | 直接放行 |
| sensitive 敏感 | 写文件、装依赖、git commit | 按审批模式处理 |
| dangerous 高危 | rm -rf、sudo、强制推送 | 必须人工批准 |
rm -rf /、fork bomb、写磁盘设备等灾难命令直接拒绝;
② 路径防护 —— 文件读写限定在项目目录内,../ 越界直接拒绝;
③ Python 沙箱 —— 代码执行仅允许白名单模块,禁止 os / subprocess。事后追责:侧边栏「🛡️ 安全审计」记录每次调用的时间、工具、参数、决策、风险分与原因, 并汇总放行 / 询问 / 拒绝 / 高危次数。
06模型配置详解
支持的提供商(左下角 ⚙ 设置 → 🔑 API Keys)
gpt-4o · platform.openai.com
claude-sonnet · console.anthropic.com
deepseek-chat · 性价比之选
moonshot-v1 · platform.moonshot.cn
qwen-max · dashscope.aliyun.com
glm-4 · open.bigmodel.cn
volcengine.com
ai.google.dev · x.ai
llama3.2 · 无需 Key,本机 ollama serve
api_base
(如 https://api.your-proxy.com/v1)+ 默认模型 + Key,
即可对接任何 OpenAI 兼容 /v1/chat/completions 服务。
Key 只保存在本地 .automind_config.json;也支持环境变量
(OPENAI_API_KEY、DEEPSEEK_API_KEY 等)。省钱与提效:各模式专用模型
设置菜单的「🖥 模型配置」面板可为五种模式分别指定不同模型——
对话用便宜快的 deepseek-chat,编程用强力的 claude-sonnet,
实现成本 / 能力的精准分配。未指定的模式沿用全局默认。
通用设置(左下角 ⚙ 设置 → 通用设置)
| 设置项 | 说明 | 建议 |
|---|---|---|
| 项目目录 | Agent 一切文件操作的根(带可视化目录浏览器) | 为不同项目切换对应目录,准确又安全 |
| Temperature | 0–2,越低越严谨、越高越发散 | 代码 0–0.3;创意 0.7+ |
| 最大输出 Token | 单次回复长度上限 | 默认即可,长文档任务调大 |
07工具面板:工具 / 技能 / MCP / 插件
侧边栏「🔧 工具面板」四个分段,对应 AutoMind 的四类可扩展能力。
🔧 工具 —— Agent 的"手"
| 工具 | 等级 | 功能 |
|---|---|---|
terminal | 敏感 | 执行命令行(装依赖、跑脚本、git) |
file_read | 安全 | 读取文件内容 |
file_write | 敏感 | 创建 / 覆盖文件 |
file_edit | 敏感 | 精确字符串替换编辑(带 diff 与回滚) |
python_sandbox | 敏感 | 沙箱执行 Python 片段(计算 / 数据处理) |
web_fetch | 安全 | 抓网页提取正文与链接 |
browser | 敏感 | Playwright 浏览器自动化 |
web_fetch 和 browser;只读分析 → 只留 file_read。✨ 技能 —— 预制的"专家流程"
| 内置技能 | 功能 | 典型指令 |
|---|---|---|
project_init | 项目脚手架(目录/pyproject/venv/git) | 「初始化一个新项目」 |
code_generator | 代码生成 / 补全 / 脚手架,带语法校验与自动修复 | 「生成一个爬虫脚本」 |
test_runner | 发现并运行测试、收集失败 | 「跑一下测试」 |
log_analyzer | 日志级别统计 / 错误样本 / 高频模式聚类 | 「分析这个日志文件」 |
doc_generator | 从 Python 源码生成 Markdown API 文档 | 「给 src 生成 API 文档」 |
dep_audit | 依赖审计:未固定版本 / 重复声明 | 「检查依赖健康度」 |
导入自定义技能:「📁 加载目录」批量导入 SKILL.md 技能包(YAML 头 + 指令正文,无代码);
「📄 导入 .py」导入继承 AbstractSkill 的 Python 技能(模板见 examples/03-skill-development/);
「⬇️ 一键导入桌面 skills 文件夹」直接吸收技能库。
🔌 MCP —— 连接外部工具生态
MCP(Model Context Protocol)是开放协议,接入后外部服务的工具自动出现在工具列表供
Agent 调用(文件系统、数据库、搜索、地图…)。支持单个添加(stdio 本地命令 / sse URL)
或直接粘贴 Claude Desktop 格式的 {"mcpServers": {...}} 批量导入。需先 pip install mcp。
🧩 插件 —— 生命周期钩子扩展
插件在任务开始 / 结束 / 解析后 / 计划后 / 出错等时机自动执行你的逻辑 (记日志、发通知、审计上报),不改动主程序。面板中「加载 / 卸载」即时生效。
# 插件目录结构
~/.automind/plugins/task-timer/
├── plugin.json # {"name":"task-timer","version":"1.0.0","description":"…"}
└── hooks.py # def get_hooks() -> AgentHooks
examples/04-plugin-development/。08高级功能
🔄 自主任务闭环(v0.3 新增,默认开启)
工作 / 编程模式任务完成后自动执行"质检流水线",不合格自动返工—— 把"AI 说做完了"变成"验证过真的做完了"。
| 开关(⚙ 设置 → 通用) | 作用 | 何时关闭 |
|---|---|---|
| 🧐 多Agent审查 | 工作模式完成后审阅者角色复核,可调用只读工具核实(MCP 工具共享) | 追求极致速度 / 省 Token |
| ✅ Loop 验收 | 语义验收 + 未过带反馈自动修复(≤2 轮) | 简单任务不需返工 |
| 🧪 TDD 测试 | 编程模式改 .py 即时语法验证;收尾自动跑 pytest | 项目测试极慢时 |
| ⚡ 并行执行 | 计划中互不依赖的步骤 asyncio.gather 并发 | 步骤有隐式资源冲突时 |
| 📦 子任务缓存 | 同任务内相同只读调用结果复用 | 需每次强制重读时 |
.py 后系统立即语法检查,
把 syntax_check: OK / FAILED 注入模型观察——有错它下一步就看到并立刻修复,
形成 编辑 → 验证 → 修复 闭环。另有 code_generate 工具
(语言检测、语法校验 + 自动修复、mode='complete' 代码补全)。任务内容 + 模式(五种均可)+ 间隔(每5分钟 / 每小时 / 每6小时 / 每天)。
后台调度、结果入历史、重启自动恢复。
场景:每天汇总日志错误、每小时抓数据追加 CSV、每 6 小时跑测试。
四个命中率圆环(工具/计划/任务/自我修正 + 综合平均)、上下文使用率发光条、
最近 50 次趋势折线、Token 效率、记忆系统指标。
用途:评估模型效果、监控 Token 花销、发现异常任务。
Agent 生成的 HTML(报告/图表/页面)出现在右栏列表,点击即在弹窗内直接渲染,免去手动找文件。
对话模式上传图片(可多张)配视觉模型看图问答;🎤 语音实时转文字输入(Web Speech API)。
每个浏览器独立会话 ID:团队共用一台服务,聊天记录互不可见、互不清除。
侧边栏「📚 知识库」上传 PDF/Word/MD/TXT → 自动分段 + embedding → 对话时自动检索你的资料作答(可开关)。 社区版 5 文档/10MB;专业版无限文档/200MB/多库/Reranker/引用溯源/定时重嵌入/外部向量后端; 企业版混合检索(向量+词法)/热度统计/检索审计/目录批量导入、总量不限。
对话模式相似问题秒回历史答案(0 Token)。专业版基础缓存(300 条/24h), 企业版高级缓存(2000 条/7 天 + 命中率与节省统计)。「🧭 路由与成本」视图可调阈值/清空。
按任务复杂度(长度/代码特征/多步骤,0~100 打分)自动分级选模型:简单问答走便宜小模型、复杂任务走强模型。 专业版 2 级路由,企业版 N 级 + 💰 成本仪表盘(按模型/日聚合成本 + 缓存节省)。
侧边栏「📈 观测中心」把 Agent 的执行过程画成实时更新的 DAG:任务 → 计划步骤 → 工具调用三层, 六种状态配色(待执行/执行中/成功/失败/回溯/已中断),点节点看耗时与失败原因。 社区版可看当前任务的实时 DAG(只读、仅当前任务); 专业版加实时看板(成功率 / P50·P95 耗时 / 工具热度 / 失败归因)、200 次运行历史回看与 JSON 导出; 企业版历史扩到 2000 次并按会话维度分组。全程本机内存构建,不额外消耗 Token。
社区版每日任务 100 次、工作区 3 个;专业版任务不限、工作区 30 个;企业版全部不限。 顶栏 📅 徽标实时显示当日用量,超限给出友好升级提示(跨天自动清零)。
每条 AI 消息悬浮「⧉ 复制」;每个代码块带语言标签和独立复制按钮。
09命令行与 REPL
不开浏览器也能用。安装后命令行直接可用 automind 命令。
# 单次任务(默认工作模式)
automind "创建一个 requirements.txt 包含 fastapi 和 uvicorn"
# 指定模式 / 模型 / 项目目录
automind --mode react --provider deepseek -p D:\myproj "修复 main.py 的报错"
# 信息查询
automind --version automind --list-tools
automind --list-skills automind --list-providers
Rich REPL(交互式彩色终端)
不带参数运行 automind 进入:
│ AutoMind v1.6.3 │
│ 模式: plan_and_execute · 模型: deepseek/… │
│ 输入任务开始,/help 查看命令 │
└──────────────────────────────────────┘
automind> _
| REPL 命令 | 功能 |
|---|---|
/help | 帮助 |
/mode react · /mode plan_and_execute | 切换执行模式 |
/tools · /skills | 表格列出工具 / 技能 |
/stats | 本次会话任务数与 Token |
/clear · /exit | 清屏 · 退出(带 Token 总摘要) |
| 其他任何输入 | 作为任务执行,结果 Markdown 面板渲染 |
10部署与运维(团队 / 生产)
Docker 部署
docker compose up --build
# 数据(配置/记忆/检查点)持久化在 automind_data 卷
# 镜像特性:非 root 用户、/data 工作卷、自带健康检查
生产加固环境变量(默认全关,按需开启)
| 变量 | 作用 | 建议 |
|---|---|---|
AUTOMIND_AUTH_TOKEN | 所有 API 与 WebSocket 需带 Bearer 令牌 | 暴露公网必开 |
AUTOMIND_CORS_ORIGINS | 收紧跨域来源(逗号分隔) | 配合前端域名 |
AUTOMIND_MAX_CONCURRENT | 并发任务上限(默认 8,超出 429) | 按机器性能调 |
AUTOMIND_RATE_LIMIT | /api/run 每客户端每分钟次数(0=关) | 公网建议 30 |
AUTOMIND_REDACT_SECRETS | 输出中的 API Key / 密码自动打码 | 多人环境建议开 |
AUTOMIND_ALLOWED_ORIGINS | WebSocket Origin 白名单 | 防跨站劫持 |
GET /api/health(免鉴权)返回版本 / 运行任务数 / 并发上限 / 运行时长,供探活与负载均衡。
安装 structlog 输出 JSON 结构化日志,未装自动降级标准格式。服务退出自动释放 MCP / 向量库 / 模型连接池。🗄 数据与存储(v1.1:SQLite)
v1.1 起高频数据从零散 JSON 平面文件收敛到 SQLite(WAL 模式,并发安全、增量写入)。 首次启动自动把旧 JSON 数据一次性导入,旧文件原地保留作备份,升级零感知。
| 数据 | 存储位置 | 说明 |
|---|---|---|
| 任务历史 / 团队任务 / 每日限额 | .automind/automind.db | 滚动上限 200 条历史;限额跨天自动清零 |
| 对话会话(多用户隔离) | .automind/sessions.db | 每会话最近 200 条消息 |
| 知识库(文档/片段/向量/检索日志) | .automind/kb/kb.db | 片段与向量增量落库,检索走内存热路径 |
| 配置 / API Key / 工作区 | .automind_config.json | 保持纯文本 JSON(体量小、可手工编辑) |
.automind/ 目录与
.automind_config.json 即完成全量备份;迁移到新机器原样放回即可。
SQLite 文件可用任意 SQLite 工具(如 sqlite3 CLI、DB Browser)直接查看。11常见问题 FAQ
顶部模型徽标一直是红色「未配置」?
徽标黄色带 ⚠?
任务卡住不动 / 想中断?
为什么它说「文件不存在」?
担心它乱删文件?
换台电脑打开,聊天记录不见了?
.automind/chats/ 下。Token 花得快怎么办?
想让它用我公司内部的工具?
12附录:速查表
五种模式一句话
| 模式 | 引擎 | 一句话 |
|---|---|---|
| 💬 对话 | 直连 LLM | 只聊不动手 |
| ⚙️ 工作 | Plan-and-Execute | 先列计划再逐步干 |
| 💻 编程 | ReAct 循环 | 边看边改边验证 |
| 🤝 协同 | 多智能体编排 | 专家组分工协作 |
| 🔁 循环 | Loop Engineering | 迭代到达标为止 |
常用 API 端点(二次开发)
| 端点 | 方法 | 功能 |
|---|---|---|
/api/health | GET | 健康检查(免鉴权) |
/api/run | POST | 执行任务 {task, interaction, session_id} |
/ws | WebSocket | 流式执行 + 实时事件 + 审批交互 |
/api/status · /api/stats/detail | GET | 状态 · 高级统计 |
/api/skills · /api/mcp · /api/plugins | GET/POST | 三类扩展管理 |
/api/schedule · /api/audit | GET/POST | 定时任务 · 审计日志 |
文件位置
| 内容 | 位置 |
|---|---|
| 配置与 API Keys | 项目目录 .automind_config.json |
| 聊天记录 | .automind/chats/<会话ID>.json |
| 长期记忆(向量库) | .automind/chroma/ |
| 检查点 | .automind/checkpoints/ |
| 插件 | ~/.automind/plugins/ |
| 教程示例 | 仓库 examples/ 目录 |
13更新日志
每次升级带来了什么,按版本倒序。完整记录见仓库 CHANGELOG.md。
- 🧰 ReAct 不再每步重念整本工具说明书:31 个内置工具的 schema 约 2.5 万字符(≈6k~8k token),此前每调用一步就完整下发一遍,跑 20 步就有十几万 token 花在「告诉模型它有哪些工具」上。现在按任务只下发相关的一批(默认 14 个)完整 schema,其余在系统提示里留「名字 — 一句话」目录,模型点名后再补发 —— 能力一个没少,只是不再每轮重付。
execution.react_tool_budget = 0可恢复旧行为。 - 🗜 预算告警时的「压缩」终于压在了实处:此前 80% 用量时花钱调的摘要压的是从未进入请求体的
ContextManager,白付。现在优先本地折叠 ReAct 自己的消息列表(旧的工具观察结果动辄几千字符),纯本地、不花钱,并可在用量上涨时反复触发。 - 📚 知识库不再每轮重注一遍:此前检索片段拼在提问前发出、生成完又从历史里还原,下一轮模型看不到只好再注入一次(同一份连问五轮付五遍)。现在片段作为独立消息留在会话中并逐条去重 —— 同一段只付一次,被挤出可见窗口后自动补发;用户原话不再被改写。
- 📡 失败不再伪装成「没有数据」:30 处静默
.catch(() => {})全部清理。工具面板、专家市场、定时任务、工作区、观测栏、路由与成本、知识库统计现在会分别说清「正在加载 / 加载失败(可重试,带具体原因)/ 确实一条都没有」。 - 💬 长会话与长任务不再卡:100+ 条会话默认只渲染最近 40 条(可点「载入更早」逐批展开且视线不跳动);长回答尾部改为增量解析不再平方级卡顿;执行轨迹面板保留最近 300 条并标出折叠数量,完整过程在「任务历史」与「观测中心」照常留存。
- 🧪 新增 20 条回归用例:
tests/planning/test_react_token_budget.py(工具预算挑选、休眠工具补发、压缩幂等)与tests/server/test_kb_injection_dedupe.py(同段不重复注入、新片段照常注入、挤出窗口后补发)。 - 📦 安装包更新到 v1.6.3:Windows(.exe,Certum 代码签名)、macOS(.dmg 通用二进制)、Linux(.deb amd64)三平台安装包已更新到 v1.6.3,SHA-256 校验值同步更新,可从官网下载区直接获取。
- 📦 全新安装包:Windows(.exe)、macOS(.dmg)、Linux(.deb)三平台安装包已更新到 v1.6.0,可从官网下载区直接获取,校验值同步更新。
- 📊 办公四件套: Excel(读写表格、增删行、和 CSV 互转)、 Word(读取内容、生成文档、插入表格)、 PDF(提取文字、合并、拆分、旋转)、 邮件(发送邮件、收取和查看收件箱)。 直接说"把这个表格里的数据汇总成一份 Word 报告"就行。
- 🔧 通用五件套:联网搜索、网页/接口请求、 数据库查询、文件检索(按文件名或内容找)、 压缩解压(zip / tar.gz)。
- 🤝 协同三件套:桌面通知(长任务跑完弹窗提醒)、 日历(ICS 日程文件,Windows 上还能直接写进 Outlook)、 群机器人(钉钉 / 企业微信 / 飞书 / Slack)。
- 📦 按需安装,不臃肿:办公功能依赖的库不会随主程序一起装。
桌面版已内置;用 pip 安装的用户,第一次用到时会提示一行安装命令,
照抄即可(
pip install "automind-agent[office]")。 - 🔐 外发动作一律需要你点确认:发邮件、发群消息属于「发出去就收不回」的操作, 默认每次都要经过审批。另外刻意不提供群发功能(收件人上限 20 人)—— 能被 AI 驱动的无限群发就是垃圾邮件工具,专业版同样不会解锁。 邮箱密码只从环境变量读取,不会出现在任何记录里。
- 🛡 联网与解压的安全防护:网络请求默认禁止访问内网地址 (防止 AI 被网页内容诱导去读取你的内网服务或云端凭据); 解压会校验压缩包内的路径,防止文件被释放到目录之外。
- ⭐ 社区版与专业版的分界:分界线划在具体动作上,不是整个工具 —— 社区版能真正把表格读出来、把报告写出去。 进阶动作(Excel 样式美化、Word 模板套打、PDF 加水印与加密、 企业数据库读写)属专业版。
- 🚨 阻止外部网页通过 WebSocket 操纵本机:上一版收紧了跨站访问,但 WebSocket 走的是另一条路,不受那套规则约束 —— 也就是说,你访问的任何网页 仍可能在后台连上本机 AutoMind,让它执行任务、读写文件。现已改为 默认只接受本机页面的连接,外部来源一律拒绝并记录日志。 命令行与 SDK 调用不受影响;只在本机使用无需任何额外设置。
- ✅ 「询问」模式的最后两个漏口:上一版只补了一处,另外两条执行路径
(编程模式的 ReAct 循环、工作模式的计划执行)仍会在没有审批通道或
审批出错时直接放行 —— 需要你点「批准」的操作被悄悄执行了。现已全部改为
问不到人就不做,并在界面上说明原因。
若你希望无人值守运行,请把审批模式设为「自动」或「全批准」—— 这是明确的授权表达,而不是靠配置疏漏放权。 - 🌐 收紧跨站访问(重要):此前的配置会让你浏览的任何网页都能在后台 调用本机 AutoMind 并读取结果 —— 包括让它执行任务。而本地默认又不开鉴权。 现在默认只信任本机页面;需要其它来源请显式配置。
- 📁 目录浏览限定范围:选择项目目录时不再能浏览整块磁盘,只限
主目录、当前项目与已配置的工作区。实测
C:\下可见目录从 22 个收敛到 1 个。 - 🔑 开放到局域网时自动开启鉴权:以
--host 0.0.0.0启动而又没设访问令牌时, 系统会自动生成一个随机令牌并在启动信息里醒目打印(同时保存下来)。 只在本机使用则完全不受影响,无需任何额外操作。 - 🔒 IDE 接入配置接口:该接口会返回明文访问令牌,现在未设令牌时只允许 本机读取,并禁止被缓存。
- 🔒 代码沙箱重写(最高危):此前 Agent 执行的「Python 代码」能跑出沙箱,
读写你机器上的任意文件、甚至执行任意系统命令。已重写为三层防御:
执行前静态检查、受限运行环境、并放到独立子进程里跑。
另外修复了「超时不生效」——死循环代码此前会把程序卡住无法恢复,现在会被真正终止。
说明:沙箱防的是"AI 写出的代码越权",不等于可以放心执行来路不明的代码; 确有此需要请在容器/虚拟机中部署。 - 💉 修复测试技能的命令注入:运行测试时的文件匹配参数由 AI 填写, 此前会被当成系统命令的一部分执行,构造特殊内容可执行任意命令。现在改为 参数化调用(不经过命令行解释器)并做严格字符校验。
- ✅ 修复「询问」模式可能被静默跳过:审批通道出错时(最常见的是你关掉了页面), 系统此前会默认放行,等于「询问」模式悄悄变成了「全批准」。现在一律按 拒绝处理,并在界面上说明原因。命令行审批里「直接回车」也不再等于同意。
- 📁 收紧目录浏览接口:此前任何人都能通过接口列举本机任意目录。 若你把服务开放到局域网又没设访问令牌,等于把磁盘目录结构公开了。现在 未设令牌时只允许本机访问,并禁止浏览系统敏感目录。本机选择项目目录不受影响。
- 🩹 修复长会话把输入框挤出界面:消息一多,对话面板会被内容撑破容器, 消息区不再滚动、输入框被顶到视口之外彻底看不见。实测 80 条消息时面板高度 被撑到 11821 像素(可用高度仅 648)。已修复:同样 80 条消息下消息区 正常滚动、输入框稳定停在底部。
- 🔍 任务历史可搜索、可翻页:新增关键词搜索(任务内容与产出一起匹配, 命中处高亮)、模式筛选与成功/未完成筛选;列表改为分页(每页 20 条), 不再一次性把全部记录铺出来。另外,此前界面只能看到最近 50 条,而系统实际 保留 200 条 —— 剩下的记录够不着,现在都能搜到了。
- ⏱ 执行进度看得见:输入框上方新增一条轻量进度指示 —— 当前阶段 · 第 X / N 步 · 正在做什么 · 已耗时,右侧「查看详情」可直接跳到 观测中心看完整执行过程。解决"长任务跑着跑着,界面看起来像卡住了"。 对话与编程模式没有预先生成的计划,此时不显示编造的百分比, 改用流动条表示"正在进行、总量未知"。
- ✎ 消息编辑与删除:把鼠标移到任意气泡上,右上角会浮出操作条 —— 复制 / 编辑 / 删除。此前发错问题只能"复制原文 → 手动改 → 重发"。 编辑用内联输入框(Enter 发送、 Esc 取消),重发时会自动移除该条及其之后的消息, 因为问题都改了、基于旧问题的回答留着只会让上下文自相矛盾。删除有二次确认, 且只影响本地会话记录,不会回滚已产生的文件改动。
- 🔌 断线时看得见"正在重连":新增顶部横幅,显示重连倒计时与已尝试 次数,并可点「立即重连」跳过等待;顶栏状态徽标区分「⟳ 重连中」与「○ 未连接」; 重连成功会给出提示。此前断线只有一个不起眼的灰色「未连接」, 用户常常是发消息没反应才发现。
- ⚠ 任务执行中断线不再卡死:连接一断,本次执行的结果就送不回来了, 而界面此前会一直停在"执行中"、输入框永久禁用。现在会落一张失败卡片 (带重跑入口)并解锁界面。
- 🩹 「继续此任务」改名,避免误导:经核对,本软件没有真正的断点续传—— 检查点只在任务成功结束后才写,任务失败时并不会留下检查点。所以按钮改为 「▶ 检查现状后接着做」(重发任务并要求模型先核对已完成的部分)与 「↻ 从头重跑」,并注明:两者都会重新执行一次任务,已写出的文件不会被回滚。
- 🔢 修复升级日志里的退出码记错:可见模式重试安装成功时,安装日志却仍记录 为失败码,排查升级问题时会被带偏。现已修正。
- 🎨 界面精修:气泡改用双层阴影、悬停轻微抬起,头像加内描边,滚动条静止时 隐入,输入区聚焦时整条底栏提亮,数字统一等宽字形;并补上全局键盘焦点环, 纯键盘操作时能看清焦点位置。
- 🛠 修复升级后应用不再启动:桌面版是无控制台的 GUI 进程,升级脚本又以
分离方式启动,此前没有显式指定标准输入输出句柄 —— 脚本里的重定向和管道
全部失效,批处理在装之前就退出了,于是"应用退出、再也没回来"。现已修复,
并给脚本加了三重兜底:静默安装失败自动改用可见模式重试(装在
Program Files需要 UAC 提权)、安装前清理残留实例、 无论成败最后都把应用拉起来。安装日志与执行轨迹留在临时目录便于追查。 - ✍ 输入框草稿自动保存:打到一半切模式、切视图、关窗口,内容不再丢失, 重新打开自动回填(按会话与工作区隔离)。语音听写与模板填入的内容一并保护。
- 🎯 打开即聚焦:进入对话区、切换模式、任务跑完后自动把光标交还输入框, 省掉"先点一下输入框"这步;有弹窗时不抢焦点。
- ⧉ 自己发的提问也能复制:此前复制按钮只挂在 AI 回复上。同时改为复制 Markdown 原文(旧实现取气泡可见文本,会把复制按钮自己的图标一起带走), 并在非 HTTPS 环境下自动回退,局域网访问时复制不再失灵。
- 🚑 任务失败有了恢复入口:失败/中断从"一行红字"改为一张卡片 —— 可展开完整报错、▶ 继续此任务(从中断处续跑,不重做已完成部分)、 ↻ 重新执行、⧉ 复制错误,并针对 Key 失效、限流、超时、网络不通、 上下文超长等常见原因给出下一步建议。任务原文随卡片一起留存, 重启应用后依然能续跑。
- 📖 手册新增本章:更新日志现可在手册内直接查阅。
- 🔤 字号调节:85%~130% 无级调节,Ctrl + = / - / 0 可直接调,"标准"档与升级前像素级一致。
- ✨ 消除切换时的黑屏闪烁:对话面板改为常驻挂载、只切显示,DOM 不再重建, 顺带修复切回对话时滚动位置丢失;新增「减少动效」开关。
- ⌨ 完整快捷键系统:新增 19 项全局快捷键,按 ? 查看; 帮助弹窗内容由注册表直接生成,与实际生效的按键同源。
- 🔔 任务完成桌面通知:仅在窗口不可见时提醒,点通知跳回应用, 完成/失败/中断三种终态都会通知。
- 首个三平台同时发布的版本:Windows(代码签名)/ macOS(通用二进制 DMG)/ Linux。
- 修复 PyPI 元数据死链与许可字段。
- 兼容版界面补齐升级提示与检查更新入口。