跳到正文
今天10月7日周三3 条
10月6日周二
10月4日周日
  1. Hugging Face Blog72

    微软与 Hugging Face 发布 ThinkingBox:按数据库终态评测 AI 智能体

    微软 Copilot Studio 团队与 Hugging Face 联合发布 ThinkingBox,通过隔离的 MCP 工具会话运行智能体,再依据终端后端状态和副作用而非生成的语句来评分,覆盖 507 个有状态业务流程、每个任务重复 20 次。

    推荐理由:微软与 Hugging Face 联合发布的智能体评测基准,用数据库终态而非工具调用判断成败,并给出 20 次重复的一致性数据。

9月29日周二
9月26日周六
9月25日周五
  1. GitHub Blog · AI & ML62

    GitHub Security Lab 发布 Fuzzing Taskflow 智能体

    GitHub Security Lab 发布 Fuzzing Taskflow,一个面向 C/C++ 项目的自主模糊测试流水线,只需指向一个 GitHub 仓库,智能体就会识别入口点、分析构建系统、编写 harness、运行 AFL++、读取覆盖率报告并改进 harness,最后对每个崩溃做分诊并生成漏洞报告。

    推荐理由:GitHub Security Lab 把模糊测试的 harness 编写、覆盖率追踪与崩溃分诊交给 LLM 智能体,读者可据此判断自动化安全测试的边界。

9月18日周五
  1. GitHub Blog · AI & ML22

    GitHub Podcast 拆解五大 AI 热梗:该不该读 AI 代码、RAG 是否已死、Skills 是否取代 MCP

    GitHub Podcast 最新一期拆解了五个 AI 开发热梗:AI 生成的代码仍需阅读和负责,只是审查力度应按风险分级;Skills 与 MCP 解决不同问题,前者是打包的团队经验,后者是连接工具与数据的标准接口,二者可组合使用。RAG 并未消亡,它为模型提供训练数据之外的信息,减少 token 浪费并让回答更有依据;微调模型也不必然说明代码库糟糕,AI 反而成为代码可维护性的又一道压力测试。