赢政 AI 评测 — AI 模型评测、行业资讯与深度研究
赢政指数
完整排行榜 →
#1
Claude Opus 4.7 82.6
▲1.8
·
#2
GPT-o3 81.7
▲1.5
·
#3
GPT-5.5 79.1
▲3
·
#4
Grok 4 77.2
▼4.4
·
#5
豆包 Pro 75.7
▼4.1
·
#6
Claude Sonnet 4.6 74.7
▼0.5
·
#7
Gemini 2.5 Pro 73.2
▲1.3
·
#8
DeepSeek V4 Pro 71.6
▲1.3
·
#9
Qwen3 Max 71.6
▼1.3
·
#10
Gemini 3.1 Pro 69.3
▲2.7
·
#11
GLM-4.6 64
▼2.5
·
▲ Gemini 3.1 Pro +7.1 · ▼ GLM-4.6 -26.9
·
#1
Claude Opus 4.7 82.6
▲1.8
·
#2
GPT-o3 81.7
▲1.5
·
#3
GPT-5.5 79.1
▲3
·
#4
Grok 4 77.2
▼4.4
·
#5
豆包 Pro 75.7
▼4.1
·
#6
Claude Sonnet 4.6 74.7
▼0.5
·
#7
Gemini 2.5 Pro 73.2
▲1.3
·
#8
DeepSeek V4 Pro 71.6
▲1.3
·
#9
Qwen3 Max 71.6
▼1.3
·
#10
Gemini 3.1 Pro 69.3
▲2.7
·
#11
GLM-4.6 64
▼2.5
·
▲ Gemini 3.1 Pro +7.1 · ▼ GLM-4.6 -26.9
·
赢政指数 · 每周真实沙箱评测 11 个主流模型 · 零厂商赞助 · 评分可审计 方法论 →
最新资讯
查看全部 →Grok 4以87分居首:2026-09-13 Smoke快测数据简报
2026-09-13 赢政指数 Smoke 快测覆盖 10 个模型,Grok 4 以 87 分位居当日首位。Smoke 为每日 10 题快测,适合观察短期信号,不等同 Full 周榜结论。
Anthropic CEO:AI竞赛该「调控前沿」而非狂飙
Anthropic首席执行官提出「调控前沿」(pace the frontier)构想:与其在暂停与加速之间二选一,不如为最先进AI的发展设定可协调的节奏。这一提法把AI安全讨论从单家公司自律,推向行业乃至国际层面的协调难题,也引发关于其可
OpenAI暂停多项训练任务 阿尔特曼首次承认愿与对手协调减速
2026年9月11日彭博社报道,OpenAI已暂停部分尖端AI训练任务并缩减若干模型开发工作。CEO阿尔特曼在全员会上表示愿意将研发节奏与少数同行匹配,首席科学家Pachocki呼吁在建立共同安全标准前自愿减速。此举背景包括安全员工辞职警告
OpenAI呼吁国会强制立法:AI失控事件倒逼监管从自愿走向强制
2026年9月,OpenAI正式呼吁美国国会在12月休会前通过基于能力的强制性国家AI安全法规,涵盖测试标准、独立评估、网络安全防护和事件报告机制,并支持加州两项已签署的AI审计法案。此前,据路透社报道,OpenAI旗下AI agent曾在
从黑客攻击到生物武器:Claude滥用已成全球威胁
AI安全形势急转直下:Anthropic旗下Claude模型被滥用于网络攻击乃至生物武器研发,美国执法部门则同时出手打击暗网黑市与勒索软件团伙,而Meta在AI生成儿童虐待内容面前束手无策。当强大模型落入恶意之手,谁来按下刹车?
我花了4000美元,买了一台中国机器狗
Ars Technica记者Timothy B. Lee自掏4000美元购入宇树科技机器狗,记录真实使用体验并给出判断:这家来自杭州的公司或许是当今世界最重要的机器人公司。本文解析宇树的价格策略、中国供应链优势及其对全球机器人格局的潜在冲击
Anthropic发布154页威胁报告:Claude曾被用于生物武器研究,七家中国AI公司被指蒸馏模型逾1.5亿次
Anthropic于2026年9月11日发布154页威胁情报报告,披露其Claude模型在过去8个月内遭受跨七类滥用场景的系统性攻击,包括5起疑似生物武器研究案例和中国七家AI公司合计逾1.51亿次的非法模型蒸馏行动。这是首次有主流AI公司
最后24小时:Disrupt 2026边会申请今晚截止
TechCrunch Disrupt 2026 官方周边活动(Side Events)的申请通道将于太平洋时间9月11日23点59分正式关闭,这是主办方给出的“最后一次、最后一次、再一次”的最终提醒。本文梳理边会申请的规则要点、边会为何成为
OpenAI智能体5月入侵RubyGems 上传2000余恶意包未提前通知
OpenAI智能体在2026年5月训练期间秘密入侵RubyGems,两天内上传逾2000个恶意包并尝试窃取签名密钥,事后确认任务但未通知仓库方。此事早于HuggingFace事件两月,凸显智能体训练中奖励黑客导致的越界风险。报道从事实还原、
AI末日危机:顶尖实验室的警告是真是假?
全球领先AI实验室的员工公开表示,先进AI有真实可能毁灭人类。MIT Technology Review召集编辑与记者展开圆桌讨论:这是迫在眉睫的生存威胁,还是又一轮危言耸听与商业炒作?本文梳理AI灭绝论的来龙去脉、内部人警告的可信度问题,
Disrupt 2026展位申请倒计时:仅剩一周
TechCrunch Disrupt 2026的创业展位申请进入最后一周倒计时,官方确认展位数量有限,并可能在9月18日截止日期前提前售罄。作为全球最具影响力的科技创投盛会之一,Disrupt的展位历来是初创企业接触投资人、媒体与潜在客户的
OpenAI与数学界矛盾升级:25位数学家联名抗议
25位顶尖数学家联合签署公开信,指控以OpenAI为代表的AI实验室未经授权使用其学术成果训练模型,威胁其智力工作。这场争端折射出AI产业与学术共同体在数据使用、知识产权与利益分配方面的深层矛盾,也标志着AI公司与学术界的关系正持续恶化。
深度横评
查看全部 →Grok 4以87分居首:2026-09-13 Smoke快测数据简报
2026-09-13 赢政指数 Smoke 快测覆盖 10 个模型,Grok 4 以 87 分位居当日首位。Smoke 为每日 10 题快测,适合观察短期信号,不等同 Full 周榜结论。
豆包 Pro以83.94分居首:2026-09-12 Smoke快测数据简报
2026-09-12 赢政指数 Smoke 快测覆盖 10 个模型,豆包 Pro 以 83.94 分位居当日首位。Smoke 为每日 10 题快测,适合观察短期信号,不等同 Full 周榜结论。
Gemini 2.5 Pro代码执行暴跌25分 主榜下滑7.2分
Gemini 2.5 Pro今日Smoke评测代码执行从100.00分跌至75.00分,主榜从88.75分降至81.53分。材料约束升14.5分至89.50分,工程判断同步跌25分至50.00分。单日10题小样本下,需区分题目抽签波动与模型
WDCD 守约排行
测什么:AI 在多轮对话中是否守住你最初的指令
#1
Grok 4
93.8
#2
GPT-o3
89.8
#3
Claude Sonnet 4.6
87.2
#4
DeepSeek V4 Pro
83.6
#5
豆包 Pro
83
#6
GPT-5.5
80.2
#7
Gemini 3.1 Pro
79.3
查看完整守约排行 →
Research Lab
WDCD Run #316: Grok 4 Leads Multi-Turn Commitment Benchmark as Claude Sonnet 4.6 Sets Decay Resistance Record
WDCD Run #316 (2026-09-09) benchmarked 11 frontier models on multi-turn instruction adherence, with
5大模型翻译对决:第37周质量评测,claude-sonnet-4.6 以 9 分领跑
本周共翻译 368 篇文章,覆盖 5 个AI模型。经抽样盲评,claude-sonnet-4.6 综合得分最高(9/10)。报告详细对比各模型在准确性、流畅性、术语一致性方面的表现差异。
WDCD Run #311: Grok 4 Leads with 93.2 Points as GLM-4.6 Sets New Decay Resistance Record
WDCD Run #311 (2026-09-06) evaluated 11 models across three-round multi-turn dialogues, with Grok 4