又快又能打!匿名模型玉兔模型杀上双榜第一,Coding实测全记录

发布时间 2026-09-27 3 天前
来源 量子位
字数 2,370 字
查看原文

AI智能总结

中秋假期,匿名模型 Space Bunny(测试代号"tuerye",使用 OpenRouter API 通过 DeepSeek Harness 调用)在 OpenRouter 与 OpenCode 双榜调用日榜登顶。

关注前沿科技 2026-09-27 21:32 北京

中秋假期稳居 OpenRouter 调用日榜榜首

衡宇 发自 凹非寺

量子位 | 公众号 QbitAI

服都服了,又是哪家模型搞匿名啊,大过节的搁这儿杀出来冲榜?!

说的就是你,Space Bunny。

一个没留神,它在短短几天里经历了突然出现->突然热度飙升->突然干到 OpenRouter、OpenCode 双榜调用日榜第一->突然讨论热度也飙升。

扫了一眼,推特和 Reddit 上目前的整体风向是这样的:

有说 unbelievable 的(be like @CoderGeeta)。

不少用户反馈输出效果不错(be like @Fei2411)。

还有夸速度快,"打败了 Astra"的(be like @marcthecreatorr)。

真的吗?

我不信。

所以在迷人又珍贵的中秋假期最后一天,我做了一个违背祖宗的决定——管他是谁家的匿名模型,先测了再说吧。

猜它是谁干嘛,快开蹬啊

先跟大家说一声,我是从 OpenRouter 上拿的 API,接到了 DeepSeek Harness(为公平起见我用了之前我没用过的 DSH,惭愧)里面,给 Space Bunny 随便取了个名字叫"tuerye"。

昨晚上和今天上午都在使劲蹬,然后随机抽取,最后放了 4 个 case 在这篇稿子里。

可能附带一些我自己的个人主观弹幕,但主要还是为了呈现。

欢迎大家给自己的判断。

我这个人吧有点执念,这个世界上的匿名模型,管他大王小王,通通都要给我拉来测 coding 能力。

最近最火的除了 Astra 操控 Blender,还有的就是 3D 玩法了。

那就上强度吧,我让它"用 Three.js 构建一个详细的立方体风格天坛,包含交互式细节"。

任务一开始跑我就搁旁边看《花少2》8 小时版本去了……大概一个多小时不到两个小时吧,想起来看了一眼居然就跑完了,比我预想中快很多。

效果见视频:

我给编辑部几位同事看了下,满足"交互"这个条件就不说了,它自己加了些我压根儿没提的细节,比如底部控制条里还有夜、黎明、正午三个时刻和雨、烟的天气开关;昼夜还会自行循环,一天约 3.5 分钟,时辰文字也随时间从子时走到亥时。

反正总体而言大家都觉得 Space Bunny 的初战效果比较令人满意。

而且说出来都丢脸,做完了我才想起来 DSH 它,没!长!眼!睛!

所以评分方面再给这兔子加一颗星,表达我的歉意。。。

OK,展示第二个任务,给咱做一个苹果系统的、更适合中国宝宝体质的闹钟。

这个功能其实 iOS 27 说是有了,但身在中秋假期在这儿为爱测评的我,脑子里啪一下就冒出了这个需求。

Space Bunny 耗时共 22 分钟 46 秒。

做出来的闹钟,响铃时的界面是这样的,霸占整个 Mac 的屏幕。

很霸道但也很简洁:

一轮跑出来界面是这样的:

按理说一轮就够用,但我还是又让它加个每个月到底闹铃响不响的功能,起床时间也调到 7:23。

我们早八人是这样的,能多睡一分钟就尽量多睡一分钟。。。

这任务吧实用性比较强,咱们主要来看看 readme 里面它记录的思考。

iOS 的硬性限制它也考虑到了:

但你们要不要看下我在这里看到了什么。。。

这是什么。。。

晕倒了我已经。

怕自己贴截图的时候再次晕倒,所以赶紧来看第三个 Coding 任务吧,让 Space Bunny 做个 App。

"做一个 mac app,把 dsh 当前的思考像字幕一样打在屏幕上。"

好消息是这玩意儿做起来就很快,可能不到 5 分钟?

我在飞书页面写这篇稿子呢,非常短的时间里屏幕上就冒出来了个这个,给我吓一跳。

坏消息是这次它自己脑补的细节就没有天坛那个丰富,初次交差的版本确实一直在显示 DSH 的脑回路,但窗口不能拖动挪动,也没有关掉和最小化。

这个位置一度挡住了我和 DSH 的对话框,我沉默许久,终于想起来可以给窗口缩小咯(可能是还沉浸在中秋尾声,今天测试的诸多环节我好像都失了智,好在 Space Bunny 智商还挺在线的)。

但我还是无能地勃然小怒了一下:

不到 15 分钟,且是在我开了多个任务同时跑的前提下,它给改好了。

现在就是随便挪,任意挪,想咋挪就咋挪。

而且没有思考的时候它会变得小小只。

我觉得海星?还不错!

不过也有两个问题。

一个是它自己说的,"合成鼠标事件在这个环境里会被系统丢掉一部分,所以「拖动是否与指针 1:1 同步」我没法在无头环境里断言——我改成了直接跟指针的屏幕位移(两端都是 AppKit 坐标,不存在符号翻转),你手动拖一下最准。"

另外就是拖动的时候会像小星星一样一闪一闪的?

这个不是啥大问题,应该就是因为实时显示脑回路所以窗口忽大忽小的,我又在拿鼠标拖拽,两套操作有点打架。

回头再交互一轮简单打磨下就好了。

讲真最近测的好几个模型都这样,首轮出来总会有些小细节有 bug,肯定是没有 Astra 这种惊艳你一跳又一跳的 feel,但拿来干活跑跑代码肯定是没问题的。

也就是首轮结果出来过后自己要再手动提点小建议,一般一轮就能解决。

如果要增加新功能就再交互再跑。

Reddit 上有老哥跟我体感是一样的:

我测试过程中几乎没有出现一轮解决不了的问题。

只有一次,跑了个"给 GitHub 某仓库的文章列表增加 cursor 分页和标签组合筛选,补全测试且保持旧接口可用"的任务,看到它声称"全部检查通过",随后又说明 lint 仍有 33 个错误,有点 bug。

但这个问题一说也马上就改了,我还让 codex 帮我审了一遍,人家也说没问题。

前前后后测了十几个 coding 任务都给我测累了,于是我的魔爪又伸向了多模态。

丢给它一个特斯拉擎天柱吧台优雅营业的视频,就是这个:

△ 视频来源 𝕏 @cb_doge

问 Space Bunny(写到这里我脑子里有一瞬间无理由飘过"这兔子不会是 Grok 吧"):

这个机器人干嘛呢?

中间流程太复杂了,直接上最终结果:

讲道理这个任务不知道为什么缓存命中有点低?

我看了下,除了这个任务其余的缓存命中率都在 95% 以上⬇️