模型能力提升为何未转化为用户感知?再访阿里国际站张阔

发布时间 2026-10-09 5 小时前
来源 硅谷101
字数 1,703 字

这期主要在讲什么

这期节目是硅谷101主播Yiwen再次对话阿里国际站总裁张阔,围绕一个核心困惑展开:模型在通用评测榜单上越来越强,但商家把真实业务交给AI时,为什么依然要反复解释和兜底?他们用107个真实经营任务做了一次实测,发现最前沿模型在无人干预下通过率只有61%左右,并由此聊到Agent在商业场景里的真正瓶颈、通用模型与垂直产品的关系,以及人机协作中哪些判断仍不可替代。

核心知识点

  • 阿里国际站团队整理了107个真实经营任务——比报价、识别钓鱼邮件、订船期、处理纠纷——发现最前沿模型在无人干预下通过率仅约61%,与榜单高分形成明显落差。
  • 商业任务比编程更难,因为Agent既要能跑通流程,也要理解商家背后的生意目标和成本、交期、利润等约束。
  • 好用的Agent不只是模型强,而是模型、工程框架和上下文三者的乘积,模型与工程必须联合优化,不能只等模型升级。
  • 为不同任务匹配不同能力的模型(多模型路由),在成本和效果之间做权衡,比一味用最贵模型更现实。
  • AI时代小企业有机会借助Agent把生意做得更大,但产品品味、市场判断、预算分配这些老板层面的决策仍需人来拍板。

值不值得听

值得听,特别适合做B2B、跨境电商或对AI Agent落地感兴趣的听众,能从真实业务数据里看到榜单之外的AI现状。