
应用与工具
新工具、新功能,以及它们能帮你完成什么。
Copilot 开放桌面操作预览,可跨应用完成任务
GitHub 10月1日宣布,Copilot CLI 与 Copilot app 在 macOS、Windows 上公开预览电脑操作功能。需要整理浏览器通知、更新演示文稿或跨应用搬运信息的用户,可让 Copilot 读取界面、点击、输入、滚动和拖拽。
Copilot app 可在设置中的 Computer Use 页面开启;CLI 可输入 /computer on。控制应用前会请求批准,用户可查看或重置始终允许的应用。macOS 还需授予辅助功能和屏幕录制权限,组织管理设置可以禁用此功能。
没有程序接口的旧软件也能进入自动化流程。试用时应明确涉及哪些应用、允许修改什么,并检查持续授权的范围。
技术与开发
模型、API、开源与工程实践,关注能力和使用边界。
Copilot 动态工作流开放预览,用代码规定协作步骤
GitHub 10月1日推出动态工作流公开预览,覆盖 Copilot CLI、Copilot app 和 SDK(软件开发工具包),适用于所有 Copilot 套餐。它让开发者用代码规定任务步骤,把命令、工具调用和一个或多个智能体的分析组合起来,支持串行或并行执行。
工作流置于 Copilot 扩展中,可传递结构化结果、让子智能体交叉核验,并在检查点暂停供人审阅;请求用户输入取决于客户端支持。Copilot app 无需额外设置,最新版 CLI 需通过 --experimental 或 /experimental on 开启实验功能。
固定流程适合反复执行的发布检查和代码审查:把顺序、检查点写入代码,有助于复查每一步,并控制长任务何时继续。
微软发布流式转写模型,优惠价每小时0.54美元
据 IT之家10月2日转述,微软于10月1日发布 MAI-Transcribe-2-Streaming,支持60种语言及自动、连续的语言检测。流式转写会在讲话过程中持续返回文字,并随上下文修正,适合实时字幕、客服和语音交互。
当前优惠价格为每小时0.54美元,可通过 Microsoft Foundry、MAI Playground、OpenRouter 体验或接入。
报道援引 Artificial Analysis 9月28日榜单:其最终词错误率为2.50%,最终转录延迟为0.13秒。词错误率衡量转写中的词语错误;最终转录延迟也不同于首批文字出现的时间,不能据此认定所有语言和场景都能达到同一表现。
实时字幕和语音助手可关注流式版本;评估时应分别测量首段文字出现速度与最终结果稳定时间,并使用目标语言和真实噪声条件验证。
NAT-ARC 用自然图像预训练提升格子推理
据量子位10月1日报道,何恺明团队提出 NAT-ARC,用自然图像预训练的视觉编码器处理 ARC 彩色格子推理题,无需把格子转成文字交给大语言模型。模型先复用公开的图像预训练权重,再进行 ARC 训练,测试时针对每道题微调。
报道援引论文结果:在 ARC-1 上,约6亿参数的最佳单模型取得63.4±0.7%的 pass@2,约20亿总参数的集成方案达到70.2±0.6%。pass@2 指允许提交两个候选答案时的通过表现,不能视为一次作答准确率或通用推理成绩。
这项结果为视觉预训练迁移到抽象任务提供了证据。但测试时逐题微调、集成投票均涉及额外计算,参数量较小不能直接等同于总成本更低。
AFTER READING
读完之后
本期值得关注的是桌面操作与流程编排的开放,以及实时转写和纯视觉推理的新进展;预览功能与研究成绩仍需结合具体任务判断。
评论