Terminal-Bench 2.1
Terminal-Bench 2.1 Articles
Browse 5 articles about Terminal-Bench 2.1.

OrcaSAQ2 27B Benchmarks: How a 3-Bit Model Rivals Claude on SWE-bench
OrcaSAQ2 27B hits 70% on SWE-bench Verified and 58.4% on Terminal-Bench 2.1 from a 12.3 GB checkpoint. Here's what the numbers actually mean.
OrcaSAQ2 benchmarkSWE-bench Verified 27BTerminal-Bench 2.1

Xing4.0-29B-A4B Benchmarks: China Telecom's MoE Model Tested
Xing4.0-29B-A4B benchmark scores on SWE-bench, Terminal-Bench, and Claw-Eval, compared against Qwen3.6-35B-A3B and Gemma4-26B-A4B.
Xing4.0-29B-A4B benchmarksTeleChat MoE modelAscend NPU LLM

Xing4.0-29B-A4B: China Telecom's Ascend-Trained MoE Model Explained
Xing4.0-29B-A4B is a 29B MoE model trained fully on Ascend NPUs, with 256K context and coding scores beating Gemma4 and Qwen3.6 on several benchmarks.
Xing4.0-29B-A4BChina Telecom AI modelAscend NPU training

K2-Horizon-MoVA-36B-A4B Benchmarks: A 4B-Active Model That Punches Up
K2-Horizon-MoVA-36B-A4B uses just 4B active parameters yet beats larger MoE and dense models on agentic tool use and Terminal-Bench.
K2-Horizon benchmarksMoVA attention benchmarkNemotron 3 Ultra comparison

Ornith 1.5 35B-A3B Benchmarks: How It Stacks Up Against Qwen3.6
Ornith 1.5 35B-A3B benchmark breakdown vs Qwen3.6-35B, Gemma 4-31B and Muse Glimmer-30B across SWE-bench, Terminal-Bench, HLE and agentic tests.
Ornith 1.5 benchmarksOrnith vs Qwen3.6SWE-bench Ornith