千问办公上线Qwen3.8-Flash,专治Agent“Token焦虑”,量大管饱

2026-08-28 03:34

Agent圈现在最头疼的,不是模型不聪明,是Token烧不起。IDC预测,2026年我国企业级Token消耗量将同比增长约20倍。重度玩家一天干掉10亿Token,耗费数千美元。而且,同一个任务,Agent工作流的Token消耗是聊天机器人的5到30倍。用AI用出了理财的感觉,打开任务还要先算成本,大伤脑筋。

昨晚阿里放出Qwen3.8-Flash,千问办公第一时间接入,同步上线标准模式,模型的Token生成速度提升100%,Token消耗减少75%。

先说一下这模型:千亿总参数,仅激活60亿,官方口径性能超越Claude Opus4.6;每百万Tokens输入0.8元,输出2.7元,不到Claude Opus4.6的1/40,比DeepSeek-V4-Flash忙时价格的1/3还低。

再重点看在真实Agent场景里的数据。千问办公标准模式下,单任务生成速度提升约100%,Token消耗平均减少75%。以前写一份长报告,看着Token数字往上蹿,心里跟着发紧;现在是快速出活儿,速度翻倍、费用打骨折,可以用更少的积分消耗、更快的Token吞吐速度完成任务。

差距在哪里?不是简单的换模型,而是千问办公和千问大模型团队联合调优——针对多步规划、工具选择这些Agent高发场景反复打磨。说白了,给Agent换了套省油的动力系统。

有人说性能、成本、速度不可能三角,千问这波直接给打破了。说白了,Agent从此告别“省着用”,进入“随便用”时代。阿里这一手模型开源+低价推理+场景落地三连击,极其有利于用户。

(责任编辑:韩丽)

运营商财经(官方微信公众号yyscjrd)—— 主流财经网站,一家全面覆盖科技、金融、证券、汽车、房产、食品、医药、日化、酒业及其他各种消费品网站。

分享至:
文章关键词: