VECTOR WIREAI INTELLIGENCE
NVDA$1,847+3.2%MSFT$512+1.1%GOOGL$199-0.4%META$728+2.7%AMD$184-1.2%TSM$212+0.6%PLTR$98+4.1%AI IDX4,821+1.9%
PKT
SEEDRefresh Models Deals Regulatory Sources

TruthfulQA

20 models tracked

TruthfulQA — Distinct named benchmark, IBM Granite 3.3 card

#ModelVendorBest scoreRunsLast seen
1MAI-Thinking-1Microsoft8812026-08-23
2Qwen3.5 2BAlibaba8812026-07-05
3Phi 3.5 MoE InstructMicrosoft77.512026-08-23
4Granite 3.2 8B InstructIBM66.912026-06-11
5Granite 3.3 8B InstructIBM66.922026-08-23
6Phi 4 Mini InstructMicrosoft66.412026-08-23
7Granite 3.1 8B InstructIBM65.812026-06-11
8Phi 3.5 Mini InstructMicrosoft6412026-08-23
9Granite 3.2 2B InstructIBM59.812026-06-11
10Granite 3.1 2B InstructIBM59.812026-06-11
11Granite 3.3 2B InstructIBM5912026-06-11
12Llama 3.1 Nemotron Instruct 70BNVIDIA58.612026-08-23
13Jamba 1.5 LargeAI2158.312026-08-23
14Command R+ (Apr '24)Cohere56.312026-08-23
15Qwen2 Instruct (72B)Alibaba54.812026-08-23
16Qwen 2.5 Coder 32B InstructAlibaba54.212026-08-23
17Jamba 1.5 MiniAI2154.112026-08-23
18Llama 3.1 8B InstructMeta52.812026-06-11
19DeepSeek-R1-Distill-Llama-8BDeepSeek47.412026-06-11
20DeepSeek-R1-Distill-Qwen-7BDeepSeek47.112026-06-11

Best tracked score per model (default configuration; source-attributed and verification-tiered). Open a model for its full benchmark surface, provenance and pricing.