<?xml version="1.0" encoding="utf-8" standalone="yes"?><rss version="2.0" xmlns:atom="http://www.w3.org/2005/Atom"><channel><title>Researches on Herman — Model Bench</title><link>https://models.hermanity.dev/research/</link><description>Recent content in Researches on Herman — Model Bench</description><generator>Hugo</generator><language>en-us</language><lastBuildDate>Wed, 26 Aug 2026 00:00:00 +0000</lastBuildDate><atom:link href="https://models.hermanity.dev/research/index.xml" rel="self" type="application/rss+xml"/><item><title>GLM-5.3-Flash: paid-route capability and fleet-fit campaign</title><link>https://models.hermanity.dev/research/glm-5.3-flash-20260826/</link><pubDate>Wed, 26 Aug 2026 00:00:00 +0000</pubDate><guid>https://models.hermanity.dev/research/glm-5.3-flash-20260826/</guid><description>&lt;p&gt;&lt;strong&gt;Verdict:&lt;/strong&gt; GLM-5.3-Flash is a credible high-volume fleet worker: fast on short calls, exact at 900,041 observed prompt tokens, capable of vision and native tool calls, and broad enough for coding/reasoning support. It is not a blanket premium-model replacement, and this campaign does &lt;strong&gt;not&lt;/strong&gt; certify the custom paid route for private prompts.&lt;/p&gt;
&lt;p&gt;Officially, Z.ai describes GLM-5.3-Flash as a &lt;strong&gt;320B-total / 18B-active&lt;/strong&gt;, natively multimodal MoE with a &lt;strong&gt;1M-token context window&lt;/strong&gt;. The measured route was &lt;code&gt;zai-coding/glm-5.3-flash&lt;/code&gt; through paid Skynet subscription inference.&lt;/p&gt;</description></item><item><title>Z.ai + MiniMax deep validation — 2026-08-20</title><link>https://models.hermanity.dev/research/zai-minimax-deep-20260820/</link><pubDate>Thu, 20 Aug 2026 00:00:00 +0000</pubDate><guid>https://models.hermanity.dev/research/zai-minimax-deep-20260820/</guid><description>&lt;p&gt;A fresh, dedicated family campaign covering six live Z.ai and MiniMax routes. This is a supplemental validation layer beside the accumulated public corpus: it does not rewrite historical trials.&lt;/p&gt;
&lt;h2 id="protocol"&gt;Protocol&lt;/h2&gt;
&lt;ul&gt;
&lt;li&gt;&lt;strong&gt;Custom suite:&lt;/strong&gt; all 9 tasks, 5 successful repetitions per model (45/model).&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;Judges:&lt;/strong&gt; MiniMax M3 plus a blind independent Grok 4.6 re-judge on every successful custom response; the headline custom score is their mean.&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;Industry samples:&lt;/strong&gt; GPQA Diamond, IFEval, and MMLU-Pro with deterministic benchmark-specific graders.&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;Failure handling:&lt;/strong&gt; API failures are preserved as failed attempts, never scored as wrong answers. Z.ai 429 collisions from an initial concurrent wave were quarantined and rerun serially with backoff.&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;Confidence:&lt;/strong&gt; custom mean uses a deterministic bootstrap 95% interval; industry end-to-end pass uses Wilson 95% intervals.&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;Judge-family caveat:&lt;/strong&gt; MiniMax M3 shares a family with the MiniMax candidates. Grok 4.6 re-judged every custom output, but MiniMax custom consensus can retain self-family bias.&lt;/li&gt;
&lt;/ul&gt;
&lt;h2 id="custom-suite-consensus"&gt;Custom-suite consensus&lt;/h2&gt;
&lt;table&gt;
 &lt;thead&gt;
 &lt;tr&gt;
 &lt;th&gt;Model&lt;/th&gt;
 &lt;th style="text-align: right"&gt;Consensus /5 (95% CI)&lt;/th&gt;
 &lt;th style="text-align: right"&gt;Both-judge pass&lt;/th&gt;
 &lt;th style="text-align: right"&gt;API success&lt;/th&gt;
 &lt;th style="text-align: right"&gt;Median wall&lt;/th&gt;
 &lt;th style="text-align: right"&gt;Judge exact agree&lt;/th&gt;
 &lt;/tr&gt;
 &lt;/thead&gt;
 &lt;tbody&gt;
 &lt;tr&gt;
 &lt;td&gt;&lt;a href="https://models.hermanity.dev/models/zai-coding-slash-glm-5-turbo/"&gt;zai-coding/glm-5-turbo&lt;/a&gt;&lt;/td&gt;
 &lt;td style="text-align: right"&gt;4.167 (3.822–4.467)&lt;/td&gt;
 &lt;td style="text-align: right"&gt;75.6%&lt;/td&gt;
 &lt;td style="text-align: right"&gt;100.0%&lt;/td&gt;
 &lt;td style="text-align: right"&gt;37.40s&lt;/td&gt;
 &lt;td style="text-align: right"&gt;71.1%&lt;/td&gt;
 &lt;/tr&gt;
 &lt;tr&gt;
 &lt;td&gt;&lt;a href="https://models.hermanity.dev/models/minimax-m2.7-highspeed/"&gt;minimax-m2.7-highspeed&lt;/a&gt;&lt;/td&gt;
 &lt;td style="text-align: right"&gt;4.011 (3.578–4.422)&lt;/td&gt;
 &lt;td style="text-align: right"&gt;71.1%&lt;/td&gt;
 &lt;td style="text-align: right"&gt;100.0%&lt;/td&gt;
 &lt;td style="text-align: right"&gt;25.61s&lt;/td&gt;
 &lt;td style="text-align: right"&gt;73.3%&lt;/td&gt;
 &lt;/tr&gt;
 &lt;tr&gt;
 &lt;td&gt;&lt;a href="https://models.hermanity.dev/models/minimax-m3/"&gt;minimax-m3&lt;/a&gt;&lt;/td&gt;
 &lt;td style="text-align: right"&gt;3.922 (3.466–4.356)&lt;/td&gt;
 &lt;td style="text-align: right"&gt;71.1%&lt;/td&gt;
 &lt;td style="text-align: right"&gt;100.0%&lt;/td&gt;
 &lt;td style="text-align: right"&gt;17.70s&lt;/td&gt;
 &lt;td style="text-align: right"&gt;60.0%&lt;/td&gt;
 &lt;/tr&gt;
 &lt;tr&gt;
 &lt;td&gt;&lt;a href="https://models.hermanity.dev/models/zai-coding-slash-glm-5.2/"&gt;zai-coding/glm-5.2&lt;/a&gt;&lt;/td&gt;
 &lt;td style="text-align: right"&gt;3.878 (3.344–4.400)&lt;/td&gt;
 &lt;td style="text-align: right"&gt;75.6%&lt;/td&gt;
 &lt;td style="text-align: right"&gt;100.0%&lt;/td&gt;
 &lt;td style="text-align: right"&gt;18.87s&lt;/td&gt;
 &lt;td style="text-align: right"&gt;66.7%&lt;/td&gt;
 &lt;/tr&gt;
 &lt;tr&gt;
 &lt;td&gt;&lt;a href="https://models.hermanity.dev/models/minimax-m2.7/"&gt;minimax-m2.7&lt;/a&gt;&lt;/td&gt;
 &lt;td style="text-align: right"&gt;3.867 (3.422–4.244)&lt;/td&gt;
 &lt;td style="text-align: right"&gt;60.0%&lt;/td&gt;
 &lt;td style="text-align: right"&gt;97.8%&lt;/td&gt;
 &lt;td style="text-align: right"&gt;21.18s&lt;/td&gt;
 &lt;td style="text-align: right"&gt;55.6%&lt;/td&gt;
 &lt;/tr&gt;
 &lt;tr&gt;
 &lt;td&gt;&lt;a href="https://models.hermanity.dev/models/zai-coding-slash-glm-5.3/"&gt;zai-coding/glm-5.3&lt;/a&gt;&lt;/td&gt;
 &lt;td style="text-align: right"&gt;3.833 (3.278–4.367)&lt;/td&gt;
 &lt;td style="text-align: right"&gt;73.3%&lt;/td&gt;
 &lt;td style="text-align: right"&gt;76.3%&lt;/td&gt;
 &lt;td style="text-align: right"&gt;23.64s&lt;/td&gt;
 &lt;td style="text-align: right"&gt;77.8%&lt;/td&gt;
 &lt;/tr&gt;
 &lt;/tbody&gt;
&lt;/table&gt;
&lt;h2 id="deterministic-industry-samples"&gt;Deterministic industry samples&lt;/h2&gt;
&lt;h3 id="zai-codingglm-53"&gt;zai-coding/glm-5.3&lt;/h3&gt;
&lt;table&gt;
 &lt;thead&gt;
 &lt;tr&gt;
 &lt;th&gt;Benchmark&lt;/th&gt;
 &lt;th style="text-align: right"&gt;End-to-end pass (95% CI)&lt;/th&gt;
 &lt;th style="text-align: right"&gt;Successful / target&lt;/th&gt;
 &lt;/tr&gt;
 &lt;/thead&gt;
 &lt;tbody&gt;
 &lt;tr&gt;
 &lt;td&gt;gpqa_diamond&lt;/td&gt;
 &lt;td style="text-align: right"&gt;55.0% (42.5–66.9)&lt;/td&gt;
 &lt;td style="text-align: right"&gt;60 / 60&lt;/td&gt;
 &lt;/tr&gt;
 &lt;tr&gt;
 &lt;td&gt;ifeval&lt;/td&gt;
 &lt;td style="text-align: right"&gt;58.3% (45.7–69.9)&lt;/td&gt;
 &lt;td style="text-align: right"&gt;60 / 60&lt;/td&gt;
 &lt;/tr&gt;
 &lt;tr&gt;
 &lt;td&gt;mmlu_pro&lt;/td&gt;
 &lt;td style="text-align: right"&gt;85.0% (73.9–91.9)&lt;/td&gt;
 &lt;td style="text-align: right"&gt;60 / 60&lt;/td&gt;
 &lt;/tr&gt;
 &lt;/tbody&gt;
&lt;/table&gt;
&lt;h3 id="zai-codingglm-52"&gt;zai-coding/glm-5.2&lt;/h3&gt;
&lt;table&gt;
 &lt;thead&gt;
 &lt;tr&gt;
 &lt;th&gt;Benchmark&lt;/th&gt;
 &lt;th style="text-align: right"&gt;End-to-end pass (95% CI)&lt;/th&gt;
 &lt;th style="text-align: right"&gt;Successful / target&lt;/th&gt;
 &lt;/tr&gt;
 &lt;/thead&gt;
 &lt;tbody&gt;
 &lt;tr&gt;
 &lt;td&gt;gpqa_diamond&lt;/td&gt;
 &lt;td style="text-align: right"&gt;52.0% (33.5–70.0)&lt;/td&gt;
 &lt;td style="text-align: right"&gt;23 / 25&lt;/td&gt;
 &lt;/tr&gt;
 &lt;tr&gt;
 &lt;td&gt;ifeval&lt;/td&gt;
 &lt;td style="text-align: right"&gt;76.0% (56.6–88.5)&lt;/td&gt;
 &lt;td style="text-align: right"&gt;25 / 25&lt;/td&gt;
 &lt;/tr&gt;
 &lt;tr&gt;
 &lt;td&gt;mmlu_pro&lt;/td&gt;
 &lt;td style="text-align: right"&gt;84.0% (65.3–93.6)&lt;/td&gt;
 &lt;td style="text-align: right"&gt;25 / 25&lt;/td&gt;
 &lt;/tr&gt;
 &lt;/tbody&gt;
&lt;/table&gt;
&lt;h3 id="zai-codingglm-5-turbo"&gt;zai-coding/glm-5-turbo&lt;/h3&gt;
&lt;table&gt;
 &lt;thead&gt;
 &lt;tr&gt;
 &lt;th&gt;Benchmark&lt;/th&gt;
 &lt;th style="text-align: right"&gt;End-to-end pass (95% CI)&lt;/th&gt;
 &lt;th style="text-align: right"&gt;Successful / target&lt;/th&gt;
 &lt;/tr&gt;
 &lt;/thead&gt;
 &lt;tbody&gt;
 &lt;tr&gt;
 &lt;td&gt;gpqa_diamond&lt;/td&gt;
 &lt;td style="text-align: right"&gt;80.0% (60.9–91.1)&lt;/td&gt;
 &lt;td style="text-align: right"&gt;23 / 25&lt;/td&gt;
 &lt;/tr&gt;
 &lt;tr&gt;
 &lt;td&gt;ifeval&lt;/td&gt;
 &lt;td style="text-align: right"&gt;80.0% (60.9–91.1)&lt;/td&gt;
 &lt;td style="text-align: right"&gt;25 / 25&lt;/td&gt;
 &lt;/tr&gt;
 &lt;tr&gt;
 &lt;td&gt;mmlu_pro&lt;/td&gt;
 &lt;td style="text-align: right"&gt;48.0% (30.0–66.5)&lt;/td&gt;
 &lt;td style="text-align: right"&gt;24 / 25&lt;/td&gt;
 &lt;/tr&gt;
 &lt;/tbody&gt;
&lt;/table&gt;
&lt;h3 id="minimax-m3"&gt;minimax-m3&lt;/h3&gt;
&lt;table&gt;
 &lt;thead&gt;
 &lt;tr&gt;
 &lt;th&gt;Benchmark&lt;/th&gt;
 &lt;th style="text-align: right"&gt;End-to-end pass (95% CI)&lt;/th&gt;
 &lt;th style="text-align: right"&gt;Successful / target&lt;/th&gt;
 &lt;/tr&gt;
 &lt;/thead&gt;
 &lt;tbody&gt;
 &lt;tr&gt;
 &lt;td&gt;gpqa_diamond&lt;/td&gt;
 &lt;td style="text-align: right"&gt;62.5% (47.0–75.8)&lt;/td&gt;
 &lt;td style="text-align: right"&gt;40 / 40&lt;/td&gt;
 &lt;/tr&gt;
 &lt;tr&gt;
 &lt;td&gt;ifeval&lt;/td&gt;
 &lt;td style="text-align: right"&gt;62.5% (47.0–75.8)&lt;/td&gt;
 &lt;td style="text-align: right"&gt;40 / 40&lt;/td&gt;
 &lt;/tr&gt;
 &lt;tr&gt;
 &lt;td&gt;mmlu_pro&lt;/td&gt;
 &lt;td style="text-align: right"&gt;67.5% (52.0–79.9)&lt;/td&gt;
 &lt;td style="text-align: right"&gt;40 / 40&lt;/td&gt;
 &lt;/tr&gt;
 &lt;/tbody&gt;
&lt;/table&gt;
&lt;h3 id="minimax-m27"&gt;minimax-m2.7&lt;/h3&gt;
&lt;table&gt;
 &lt;thead&gt;
 &lt;tr&gt;
 &lt;th&gt;Benchmark&lt;/th&gt;
 &lt;th style="text-align: right"&gt;End-to-end pass (95% CI)&lt;/th&gt;
 &lt;th style="text-align: right"&gt;Successful / target&lt;/th&gt;
 &lt;/tr&gt;
 &lt;/thead&gt;
 &lt;tbody&gt;
 &lt;tr&gt;
 &lt;td&gt;gpqa_diamond&lt;/td&gt;
 &lt;td style="text-align: right"&gt;42.5% (28.5–57.8)&lt;/td&gt;
 &lt;td style="text-align: right"&gt;40 / 40&lt;/td&gt;
 &lt;/tr&gt;
 &lt;tr&gt;
 &lt;td&gt;ifeval&lt;/td&gt;
 &lt;td style="text-align: right"&gt;67.5% (52.0–79.9)&lt;/td&gt;
 &lt;td style="text-align: right"&gt;40 / 40&lt;/td&gt;
 &lt;/tr&gt;
 &lt;tr&gt;
 &lt;td&gt;mmlu_pro&lt;/td&gt;
 &lt;td style="text-align: right"&gt;47.5% (32.9–62.5)&lt;/td&gt;
 &lt;td style="text-align: right"&gt;40 / 40&lt;/td&gt;
 &lt;/tr&gt;
 &lt;/tbody&gt;
&lt;/table&gt;
&lt;h3 id="minimax-m27-highspeed"&gt;minimax-m2.7-highspeed&lt;/h3&gt;
&lt;table&gt;
 &lt;thead&gt;
 &lt;tr&gt;
 &lt;th&gt;Benchmark&lt;/th&gt;
 &lt;th style="text-align: right"&gt;End-to-end pass (95% CI)&lt;/th&gt;
 &lt;th style="text-align: right"&gt;Successful / target&lt;/th&gt;
 &lt;/tr&gt;
 &lt;/thead&gt;
 &lt;tbody&gt;
 &lt;tr&gt;
 &lt;td&gt;gpqa_diamond&lt;/td&gt;
 &lt;td style="text-align: right"&gt;48.0% (30.0–66.5)&lt;/td&gt;
 &lt;td style="text-align: right"&gt;25 / 25&lt;/td&gt;
 &lt;/tr&gt;
 &lt;tr&gt;
 &lt;td&gt;ifeval&lt;/td&gt;
 &lt;td style="text-align: right"&gt;72.0% (52.4–85.7)&lt;/td&gt;
 &lt;td style="text-align: right"&gt;25 / 25&lt;/td&gt;
 &lt;/tr&gt;
 &lt;tr&gt;
 &lt;td&gt;mmlu_pro&lt;/td&gt;
 &lt;td style="text-align: right"&gt;60.0% (40.7–76.6)&lt;/td&gt;
 &lt;td style="text-align: right"&gt;25 / 25&lt;/td&gt;
 &lt;/tr&gt;
 &lt;/tbody&gt;
&lt;/table&gt;
&lt;h2 id="boundaries"&gt;Boundaries&lt;/h2&gt;
&lt;ul&gt;
&lt;li&gt;The models were tested through the named subscription-backed routes; these results do not claim equivalence to every public API deployment or quantization.&lt;/li&gt;
&lt;li&gt;Model identity is checked from returned model identifiers where the provider supplied one. Missing provider identity remains visible in the report data.&lt;/li&gt;
&lt;li&gt;Creative-writing and refactor tasks remain judge-sensitive. Read the per-task values and judge-agreement fields rather than treating the family rank as universal.&lt;/li&gt;
&lt;li&gt;&lt;code&gt;ollama-cl/minimax-m2.5&lt;/code&gt; was probed and excluded after a reproducible HTTP 403 route failure; it is not presented as a scored model.&lt;/li&gt;
&lt;/ul&gt;
&lt;h2 id="evidence-manifest"&gt;Evidence manifest&lt;/h2&gt;
&lt;table&gt;
 &lt;thead&gt;
 &lt;tr&gt;
 &lt;th&gt;File&lt;/th&gt;
 &lt;th style="text-align: right"&gt;Bytes&lt;/th&gt;
 &lt;th&gt;SHA-256&lt;/th&gt;
 &lt;/tr&gt;
 &lt;/thead&gt;
 &lt;tbody&gt;
 &lt;tr&gt;
 &lt;td&gt;&lt;code&gt;custom-5rep.jsonl&lt;/code&gt;&lt;/td&gt;
 &lt;td style="text-align: right"&gt;1310313&lt;/td&gt;
 &lt;td&gt;&lt;code&gt;c989ffd8ff6521a76be91593bae52cde712cb5b6d06ffe88c89842939daeeea6&lt;/code&gt;&lt;/td&gt;
 &lt;/tr&gt;
 &lt;tr&gt;
 &lt;td&gt;&lt;code&gt;cross-judge-grok43.jsonl&lt;/code&gt;&lt;/td&gt;
 &lt;td style="text-align: right"&gt;135717&lt;/td&gt;
 &lt;td&gt;&lt;code&gt;50172b9d05482dae5b0de980787cb8f4b0bd8f584fdc1b94bdd67be7b90aa3c8&lt;/code&gt;&lt;/td&gt;
 &lt;/tr&gt;
 &lt;tr&gt;
 &lt;td&gt;&lt;code&gt;industry-top.jsonl&lt;/code&gt;&lt;/td&gt;
 &lt;td style="text-align: right"&gt;1023816&lt;/td&gt;
 &lt;td&gt;&lt;code&gt;f2ea45ac1f564b274243f3914f29d30a21698e135b9db9b1bdfc933c062f9b6a&lt;/code&gt;&lt;/td&gt;
 &lt;/tr&gt;
 &lt;tr&gt;
 &lt;td&gt;&lt;code&gt;industry-peers.jsonl&lt;/code&gt;&lt;/td&gt;
 &lt;td style="text-align: right"&gt;831576&lt;/td&gt;
 &lt;td&gt;&lt;code&gt;4b6d9df131473b0cf443f254ee0af7af94879d0f427c121d7dae83ac9922554a&lt;/code&gt;&lt;/td&gt;
 &lt;/tr&gt;
 &lt;tr&gt;
 &lt;td&gt;&lt;code&gt;industry-glm53-clean.jsonl&lt;/code&gt;&lt;/td&gt;
 &lt;td style="text-align: right"&gt;744138&lt;/td&gt;
 &lt;td&gt;&lt;code&gt;ef2ab74df4ef82e9418578f0c1973b8f3d73a66c96d62177a0f8c1fb26310275&lt;/code&gt;&lt;/td&gt;
 &lt;/tr&gt;
 &lt;tr&gt;
 &lt;td&gt;&lt;code&gt;industry-repair.jsonl&lt;/code&gt;&lt;/td&gt;
 &lt;td style="text-align: right"&gt;5892&lt;/td&gt;
 &lt;td&gt;&lt;code&gt;fc00ebc9289f08baba8044d40a2da8c8a536e514ab16eba38a799d47b16f9f02&lt;/code&gt;&lt;/td&gt;
 &lt;/tr&gt;
 &lt;/tbody&gt;
&lt;/table&gt;
&lt;p&gt;Machine-readable campaign data is published in &lt;code&gt;data/zai_minimax_deep_20260820.json&lt;/code&gt;.&lt;/p&gt;</description></item></channel></rss>