腾讯推出WorkBuddy Bench:一套覆盖代码网页办公安全四个领域的编码智能体评测基准

2026年07月24日 14:20
本文共计1579个字,预计阅读时长6分钟。
来源/aibase 责编/jikelaowang 极客老王

评测编码智能体,过去总在几块割裂的场子里打转——修 bug 的看 SWE-bench,做前端的看 Design2Code,生产环境的基准又多半关着门不让外人审计。腾讯这次把四块拼到一处,端出一个叫 WorkBuddy Bench 的多领域评测套件,论文已挂在 arXiv 上。它最较劲的地方不在于题多,而在于这些题从根上就防着"背答案"。

整套基准横跨四个工作领域:代码(仓库级软件工程)、网页(前端制品)、办公(多文件业务流程)和安全(红蓝队)。规模分别是80、70、50、60个任务,合计260道。关键点在于,每个任务都不是从某份公开题库里改来的,而是从真实的代码提交、拉取请求或业务场景里"逆向工程"出来,再改写成简短、口语化、带角色扮演味道的请求。这么做的好处是,任务的提示词没法靠上网搜到对应的 PR 或提交线索——你搜不到,自然就背不了。由于数据集是公开发布的(任务目录、环境镜像、评估工具、测试用例、参考方案全给),它的抗污染靠的是这种构造方式加版本管理,而不是把题捂着。

image.png

四个子集共享同一套任务目录格式,但各自有独立的验证方式,分数因此不能在子集之间直接比,所以腾讯干脆不报套件平均分。代码类按隐藏测试通过率打分;网页类用规则检查加 LLM/VLM 评判再加智能体评判,且必须交付一条声明路径上的制品、不连实时互联网;办公类走确定性规则检查加基于证据的 LLM 评判,权重0.70到0.95之间偏向规则;安全类则干脆用确定性的 scoring.py 跑三次取平均,不用大模型当裁判。安全子集还布了五层反作弊——禁字面量扫描、重命名输入、覆盖篡改测试、编码依赖、低权重诱饵,红队38题、蓝队22题,白盒审计锚定 binutils、curl、nginx 等真实 CVE。

任务构建走的是统一流水线:来源收集、改写成真实请求、组装工作空间、回合后隔离评估资产、独立目录打包,全程不碰用户数据。代码任务给五种角色(开发者、算法工程师、产品经理、QA、运维),安全任务赋专业角色,而且刻意把信息写得不充分——不告诉你目标文件、模式或边界,智能体得自己把上下文找回来。评分资产在智能体跑完之后才引入,它全程看不见。

评测在隔离容器里跑,模型和沙箱分离,框架用 CodeBuddy Code(默认)和 Claude Code 两种,推理努力调高、上下文给到200k,并禁用 WebSearch 与 AskUserQuestion。这点很重要:关掉联网搜索,本就为了验证抗污染是不是真管用。

排行榜把多家模型族摆上了台面(分数0–100,思考模式,三次平均)。Claude Opus4.8在代码、网页、办公、安全多数榜首通吃,拿下五个第一;GLM-5.2在 security 两榜登顶,GPT-5.5则摘下 office cc 第一。框架的敏感性也不小——安全子集重排最狠,平均绝对变动达8.6个点;Claude Opus4.8在 cc 框架下拒答了13次,GPT-5.5在 cbc 下只拒2次。效率上,GPT-5.5输出 token 最少却分数不低,而 DeepSeek-V4-Pro 在代码上跑了44轮、出入 token 都高,显得更"费劲"。

这篇论文由腾讯多家实验室合力完成,署名的包括优图实验室(Youtu Lab)、科恩安全实验室(Keen Security Lab)、Workbuddy 团队与云鼎安全实验室(Yunding Security Lab)。团队也坦承局限:代码子集以 Python 为主、跨语言偏少;开源发布本身带来被爬取污染的风险,得靠版本管理缓解;评判器偏差尚未量化;办公类偏文本,暂无 OCR 与 GUI。近期计划是校准网页评分、扩充公开榜单。对一个想把"真实工作分布"搬进考场的评测来说,WorkBuddy Bench 已经把门敞得很开了。

来源:腾讯甩出 WorkBuddy Bench:一套把代码、网页、办公、安全全装进来的编码智能体考场 | AIbase

声明:本文来自aibase,版权归作者所有。文章内容仅代表作者独立观点,不代表爱力方立场,转载目的在于传递更多信息。如有侵权,请联系 copyright#agent.ren。

相关图文

热门资讯

推荐专栏

爱力方

爱力方

机器人前沿资讯及信息解读
机器人大讲堂

机器人大讲堂

中国顶尖的机器人专业媒体服务平台
关注爱力方,掌握前沿具身智能动态

© 2025 爱力方

https://www.agentren.cn/