Skip to content
Artwork for 硅谷101|中国版
硅谷101|中国版 · Thursday · 46 min

E255|模型越来越强,为什么用户没感觉?再访阿里国际站总裁张阔

模型在榜单上越来越强,为什么真正把工作交给AI,还是需要人反复解释、检查和兜底? 半年前,我们与阿里国际站总裁张阔聊了Accio Work,以及Agent如何参与采购和日常经营。半年后,我们再次请到他,聊聊这半年来商家使用Accio Work的真实案例,试图回答这个问题:模型能力的提升,究竟有多少变成了商家工作里的进步? 张阔分享,很多模型的通用评测成绩已经接近满分,但团队在真实经营中,并没有感受到同样幅度的提升。为此,他们从实际业务中整理了107个任务,包括比较供应商报价、识别钓鱼邮件、预订船期和处理交易纠纷。据他介绍,在这套特定评测中,最前沿模型在无人干预条件下的任务通过率约为61%。 这些任务没有数学竞赛那么耀眼,却直接关系到商家的成本、交期和利润。一个好用的Agent,既要能把工作做完,也要让人用得起;既要理解工具和流程,也要理解这盘生意究竟想追求什么。 这期节目,我们聊聊榜单成绩与实际交付之间的落差、通用模型与垂直产品的竞争,以及当AI接手越来越多的执行工作,人还需要保留哪些判断。 【主播】 Yiwen,硅谷101主持人 【嘉宾】 张阔,阿里国际站总裁 【你将听到】 从写代码到做生意,Agent还差什么? 01:18 AI同事市场:编程之外,专业工作走到了哪一步? 02:38 商业任务为什么比编程更难? 03:48 从采购搜索到日常经营,Accio Work的任务边界如何扩展 06:12 商家案例:植物监测产品,从创意走到设计、供应链和销售 07:47 找工厂、比报价、拿样品:采购流程里,人和AI如何协作 通用模型越来越强,垂直产品还有什么优势? 10:13 中美Agent生态的差异:垂直SaaS与平台工具 11:30 AI会替代SaaS吗? 14:11 独立站与平台电商:不同市场如何影响产品设计 15:16 Agent公式:模型 × 工程框架 × 上下文 17:46 模型与工程联合优化,不能只等模型升级 榜单接近满分,真实工作为什么还会失败? 20:29 107个真实任务:无人干预条件下,最前沿模型通过率约61% 24:32 报价、钓鱼邮件、订船和纠纷:怎样才算真正完成任务? 26:33 新版本也可能退步,评测必须持续做 28:55 多平台经营:有流水,不代表有利润 32:39 产品品味、市场判断与预算分配:老板仍要做的选择 最贵的模型,不一定是最好的选择 33:44 多模型路由:如何为不同任务匹配能力与成本? 38:05 多个Agent建议冲突,商家该听谁的? 40:35 上云、定时任务、事件响应与长期经营,是不同的能力 43:05 CoCreate现场:商家对Agent有哪些期待? 44:43 小企业如何借助AI,把生意做得更大 【往期相关】 E231|从B2B到A2A:Agent新基建,如何让“一人企业”做全球生意? 【监制】 泓君 【后期】 Amei 【运营】 朱婕 【BGM】 Trace - Lennon Hutton Signal Containment - Out To The World Reclaim - Megan Wofford

0:00-46:13

transcript

No transcript — this publisher did not publish one.

show notes


模型在榜单上越来越强,为什么真正把工作交给AI,还是需要人反复解释、检查和兜底?

半年前,我们与阿里国际站总裁张阔聊了Accio Work,以及Agent如何参与采购和日常经营。半年后,我们再次请到他,聊聊这半年来商家使用Accio Work的真实案例,试图回答这个问题:模型能力的提升,究竟有多少变成了商家工作里的进步?

张阔分享,很多模型的通用评测成绩已经接近满分,但团队在真实经营中,并没有感受到同样幅度的提升。为此,他们从实际业务中整理了107个任务,包括比较供应商报价、识别钓鱼邮件、预订船期和处理交易纠纷。据他介绍,在这套特定评测中,最前沿模型在无人干预条件下的任务通过率约为61%。

这些任务没有数学竞赛那么耀眼,却直接关系到商家的成本、交期和利润。一个好用的Agent,既要能把工作做完,也要让人用得起;既要理解工具和流程,也要理解这盘生意究竟想追求什么。

这期节目,我们聊聊榜单成绩与实际交付之间的落差、通用模型与垂直产品的竞争,以及当AI接手越来越多的执行工作,人还需要保留哪些判断。


【主播】

Yiwen,硅谷101主持人


【嘉宾】

张阔,阿里国际站总裁


【你将听到】

从写代码到做生意,Agent还差什么?

01:18 AI同事市场:编程之外,专业工作走到了哪一步?

02:38 商业任务为什么比编程更难?

03:48 从采购搜索到日常经营,Accio Work的任务边界如何扩展

06:12 商家案例:植物监测产品,从创意走到设计、供应链和销售

07:47 找工厂、比报价、拿样品:采购流程里,人和AI如何协作


通用模型越来越强,垂直产品还有什么优势?

10:13 中美Agent生态的差异:垂直SaaS与平台工具

11:30 AI会替代SaaS吗?

14:11 独立站与平台电商:不同市场如何影响产品设计

15:16 Agent公式:模型 × 工程框架 × 上下文

17:46 模型与工程联合优化,不能只等模型升级


榜单接近满分,真实工作为什么还会失败?

20:29 107个真实任务:无人干预条件下,最前沿模型通过率约61%

24:32 报价、钓鱼邮件、订船和纠纷:怎样才算真正完成任务?

26:33 新版本也可能退步,评测必须持续做

28:55 多平台经营:有流水,不代表有利润

32:39 产品品味、市场判断与预算分配:老板仍要做的选择


最贵的模型,不一定是最好的选择

33:44 多模型路由:如何为不同任务匹配能力与成本?

38:05 多个Agent建议冲突,商家该听谁的?

40:35 上云、定时任务、事件响应与长期经营,是不同的能力

43:05 CoCreate现场:商家对Agent有哪些期待?

44:43 小企业如何借助AI,把生意做得更大


【往期相关】

E231|从B2B到A2A:Agent新基建,如何让“一人企业”做全球生意?


【监制】

泓君

【后期】

Amei

【运营】

朱婕

【BGM】

Trace - Lennon Hutton

Signal Containment - Out To The World

Reclaim - Megan Wofford

links1