為什麼我們要做這個測試
我們的免費聊天讓每個新帳號的前 3 則回覆使用 Mistral Large 4,之後切換到 Mistral Small 4;Pro 和點數包則一直使用 Large 4。我們想知道,用實際任務而不是跑分表,什麼時候大模型值得它的價格:以官網定價,Large 4 每百萬輸入 token 收 $1.36、每百萬輸出 token 收 $4.18,Small 4 分別是 $0.15 和 $0.60,輸入大約貴 9 倍、輸出大約貴 7 倍。
方法:8 個看起來像真實工作的提示詞(不是腦筋急轉彎),各送一次給 mistral-large-4 和 mistral-small-2603,透過 chat completions API 呼叫,reasoning_effort 設為 none,temperature 0.2,輸出上限 1,500 token。時間是亞洲一台機器的實際牆鐘時間,所以你的絕對數字會不同;兩個模型之間的比例才是重點。每個提示詞只跑一次,所以小差異當雜訊看待。
