
应用与工具
新工具、新功能,以及它们能帮你完成什么。
Copilot 自动选模新增三档成本与质量偏好
GitHub 9 月 14 日为 Copilot 自动选模加入三档偏好,面向希望减少手动选模型操作的编程用户:Efficiency 偏重低成本,Balance 兼顾成本与质量,Intelligence 偏重高质量。功能正向 VS Code、Copilot CLI 命令行工具和 Copilot app 推出。
三档共用同一组可选模型,由系统针对每次请求选择。即使设为 Intelligence,简单任务也可能交给较小模型处理;费用按实际选中的模型计算。因此,档位表示选择偏好,并不绑定某个固定模型。
这三档适合表达成本与质量偏好,但不能作为单次费用的保证。判断是否划算,仍需结合实际选中的模型与任务结果。
技术与开发
模型、API、开源与工程实践,关注能力和使用边界。
Anthropic 分享智能体编码带来的测试扩容压力
Anthropic 工程师在 9 月 14 日分享内部经验:随着智能体参与编码和审查,公司持续集成任务量在半年内增长了 25 倍。持续集成是代码变更后自动运行构建、测试等检查的流程;这一增长数字仅描述 Anthropic 自身情况,不能推广到所有团队。
团队使用测试影响分析,根据历史测试结果和软件包相关性筛选需要运行的测试,并由监听、选择两个组件分别处理数据。文章指出,结果记录积压会使新测试或已修复测试无法及时影响后续选择,这一问题最终促使团队重新设计架构。
对扩大编码智能体使用规模的团队,这个案例提示:优化测试数量时,也要检查结果回流是否及时。若选择测试所依据的数据已经滞后,单纯增加执行资源可能无法解决问题。
AI 如何从试点走向生产:先明确质量、成本与监督
Anthropic 与 Accenture 于 9 月 14 日发布 AI 部署指南,按试点前、试点中和投入生产三个阶段整理七项考虑因素。指南建议先明确用户、任务、输出及可测量的质量要求,并建立总成本模型,重点在于部署过程中的责任和流程安排。
指南还列出四种人工监督程度:自动处理、抽查、逐项审阅,以及仅提供建议,建议根据输出风险选择。它为负责 AI 落地的团队提供流程参考,不涉及某个模型新增能力。
这份指南可用于试点立项和上线评审:先把可测量的质量目标、总成本与人工审核方式放到同一张决策表中,有助于判断试点是否具备进入日常业务的条件。
AFTER READING
读完之后
本期关注三件具体的事:按任务选择模型、让测试结果及时回流,以及在部署前明确质量和人工监督要求。
查看其他动态