
应用与工具
新工具、新功能,以及它们能帮你完成什么。
Manus 2.0 增加创作工作台,Cue 开启邀请体验
据量子位9月30日报道,Manus 发布2.0,原桌面应用升级为 Studio,面向视频创作者和游戏制作用户。视频编辑器支持在时间线上替换素材、调整片段与音频,用户修改后还能交回 AI 继续处理;Game Dev 提供可玩模板,可边运行边修改代码、角色和场景,并发布为网页游戏。
同轮推出的独立个人助手应用 Cue 面向手机和桌面端,目前凭邀请码抢先体验。按官方介绍,每个助手配有邮箱、电话号码、钱包和电脑,可接电话并整理摘要、在用户设定的预算内付款,也可将多个助手拉入群聊分工。此次产品面向海外用户发布,国内产品仍在筹备。
对创作者而言,可直接修改时间线有助于处理成品前的细节调整;Cue 则更适合已有明确分工和付款预算的代办任务。
技术与开发
模型、API、开源与工程实践,关注能力和使用边界。
Gemini 4 Argon 发布,先向受信任网络防御人员开放
Google DeepMind 9月30日发布 Gemini 4 Argon,重点面向软件工程、法律与金融工作,以及网络安全防御。目前通过 Fairwind 计划向一批受信任的网络防御人员逐步开放,开发者、企业和消费者的广泛开放仍属后续安排。
官方将输出上限从此前的6.4万提高至100万词元;词元是模型处理和生成内容的计量单位,这里指输出容量。公告列出的上线初期价格为每百万输入词元2美元、输出10美元,缓存输入较普通输入优惠95%。
官方报告其在衡量长程软件工程任务的 DeepSWE v1.1 上得分77.9%,在漏洞修复测试 CWE-bench v1 上得分68%。这些是特定基准成绩,不能直接换算成企业项目的完成率。
百万词元输出上限为长任务提供了更大的生成空间,但不代表每项任务都需要用满;实际选型仍须结合耗时、总用量和开放资格。
HydraFusion 扩展到 VS Code 与 Copilot app
GitHub 9月30日宣布,HydraFusion 研究预览从 Copilot CLI 扩展到 VS Code 和 Copilot app。它是协调多个模型的机制,会选择单模型直接作答、先由高效模型起草再按质量升级,或由另一模型家族的只读评审者检查后修订。
预览面向 Copilot Pro、Pro+、Business 和 Enterprise。VS Code 需1.140或更新版本,亦可使用 Insiders;在模型选择器中启用,未显示时可开启对应设置。Copilot app 需更新后在设置中开启;企业和组织用户还需管理员允许预览功能。本轮同时增加进度更新和工作流程展示,功能仍可能调整。
Hugging Face 新榜单比较多语言语音与首段音频延迟
Hugging Face 9月30日介绍 Open TTS Leaderboard,为文字转语音模型提供多语言、声音复刻与速度比较,并支持试听生成结果。它用词或字符错误率衡量可理解程度,以说话人相似度估计声音身份保留情况;这些指标不直接衡量自然度、表现力或听众偏好。
流式测试衡量首次可播放音频的等待时间:使用相同的50条英文提示、默认声音、单条生成,剔除前三次预热后取中位数。默认比较 H200 GPU,部分模型另有 CPU 结果;非流式模型则需等整段生成完成。
语音选型可先按目标语言筛选,再结合延迟指标和试听判断,避免将英文排名或识别错误率当作整体音质排名。
AFTER READING
读完之后
本期关注创作中的人工接手、多模型协作,以及新模型的实际开放范围。
评论