腾讯开源浏览器自动化, Workbuddy可以自动干活了!

作者:江枫

大家好,我是江枫。

最近逛 GitHub,发现了一个不错的工具:BrowserSkill。这是腾讯官方开源的浏览器自动化 Skills。

腾讯这次开源的 BrowserSkill 完全是给 Agent 用的。之前的很多 Browser Use 更像是大模型的一个插件。

我自己用下来,觉得有 3 个特点:

  • 可复用浏览器的真实登录状态 – 只要你登陆过,Agent 打开时就不需要重复登录。
  • 不中断当前工作 – Agent 会单独打开一个窗口进行操作,不会打扰你正在浏览器上的操作。
  • Agent 支持度高 – BrowserSkill 提供了一个名为 bsk 的 CLI 工具,Agent 直接调用 CLI 即可,什么模型都可以用。

你可以在 Claude Code、Codex、WorkBuddy 等智能体工具中安装使用。建议在 WorkBuddy 里用——都是腾讯自家产品,安装方便,适配度也高。

01 一键安装

在 WorkBuddy 中输入下面这段话进行安装:

按照 https://raw.githubusercontent.com/Tencent/BrowserSkill/main/AGENT_INSTALL.md 的说明,在本机安装并配置 browser-skill

安装分两步:① 安装 CLI,② 安装 Skills。

安装 Skills 这一步需要手动操作——在浏览器中也安装一个 BrowserSkill 的扩展工具。WorkBuddy 会打开网页,点击“添加到浏览器”即可。

走到下面这一步,就表示安装可以正常使用了。

02 上手实测

下面来上手实测,我在知乎和小红书两个平台上进行了测试。

调用 browser-skill,打开知乎,搜索 Kimi K3,找到热度最高的帖子,并归纳这篇帖子的内容。

从执行顺序看,执行得还挺快的,浏览器的操作也没有出现太多错误和重试。执行过程中会单独打开一个界面,并提示“Agent 正在控制”。你可以随时手动停止这个任务。

整个过程 4 分 40 秒,不到 5 分钟。而且在 WorkBuddy 中也没有指定某个模型,配置的是 Auto。这就是用 CLI 的好处:只要模型能够正确分解任务,网页数据的获取交给 CLI 就行,不用模型亲自去识别网页元素,所以速度蛮快。

下面再来试下小红书。

小红书是很多自媒体对标的平台,特别是帖子下的用户评论区,能看出很多产品的真实体验。

让 WorkBuddy 在小红书上搜索最火的大模型:Kimi K3,找到评论最高的帖子,并归纳用户评论。在对比了多个热度帖子后,最终找到有 704 条评论的帖子。然后选择了点赞最高的 20 条评论进行聚类归纳,最后还提供了一个评论区整体情绪画像。

测这两个 Case 时,我同时还在干别的事——浏览其他网页、微信发消息等,完全不干扰当前正在做的事。完全是 Agent 和我在并行工作。这种不干扰的模式,也是我觉得最舒服的。

写在最后

传统浏览器自动化的玩法模式是:Agent → CDP WebSocket → Chrome –remote-debugging-port

BrowserSkill 加了一层浏览器扩展做中介:CLI+Daemon 不直接碰 CDP 端口,而是把指令发到扩展,扩展再用 CDP 操作用户标签页。

将市面上几个主流的工具做了对比,BrowserSkill 和 OpenCLI 的玩法比较类似,但还是有差异:BrowserSkill 的目标用户是 Agent,OpenCLI 的第一用户还是人类。

文章来源:原文链接

© 版权声明
THE END
喜欢就支持一下吧
点赞5 分享
评论 抢沙发

请登录后发表评论

    暂无评论内容