如何评估Agent的工具使用能力
最近在疯狂学习如何评估 agent,在看模型调用工具的相关分析时莫名想起了《死亡搁浅》开头引用的「绳」。
最近在疯狂学习如何评估 agent,在看模型调用工具的相关分析时莫名想起了《死亡搁浅》开头引用的「绳」。
当我们在评估一个“Agent”的时候,我们在判断 LLM 和 harness 的哪些方面?
总体来说,目前从四个方面来评估Agent:规划、工具使用、自我反思、记忆
Skill 是实际上一个由使用说明(Skill.md)、参考文档(reference)以及可执行脚本组成的能力包。
最近在整理 Raft 项目,突然发现我对接口的幂等性理解还是不够深刻。因此再次单独整理一份笔记。
我们将传统的拥塞控制算法称为基于“丢包设计”的,代表为 TCP CUBIC 和 Reno。
TCP Reno:就是我们在教科书上最常见的拥塞控制算法,即线性增、乘性减。为了方便后文展开,先快速温习一边: