为什么我们要做这个测试
我们的免费聊天会给每个新账户前 3 次回复使用 Mistral Large 4,之后切换到 Mistral Small 4;Pro 和积分包保持使用 Large 4。我们想知道,用真实任务而不是跑分表,什么时候大模型才值这个价:按标价,Large 4 每百万输入 token 收费 $1.36、每百万输出 token 收费 $4.18,Small 4 分别是 $0.15 和 $0.60,输入大约贵 9 倍,输出大约贵 7 倍。
方法:8 个看起来像实际工作的提示词(不是脑筋急转弯),分别发给 mistral-large-4 和 mistral-small-2603,通过聊天补全 API 调用,reasoning_effort 设为 none,温度 0.2,输出上限 1,500 token。时间是亚洲一台机器上的墙钟时间,所以你的绝对数字会不同;两个模型之间的比例才是重点。每个提示词只跑一次,所以差异小的地方当噪音看。
