Goblin
News
AI news by
promptgoblins.ai
|
News
About
News
About
Filtered by:
Benchmarks
Clear
Titles
Summaries
7
GLM-5.3 Released as Open-Weight Model, Claims SOTA Coding Performance
Models
1
3d ago
7
GLM-5.3 Released as Open-Weight Model, Claims SOTA Coding Performance
Models
· 1 src · 3d ago
Discuss
6
WeChat Vision Team Releases WeMM-Embedding Multimodal Model Family
Models
1
4d ago
6
WeChat Vision Team Releases WeMM-Embedding Multimodal Model Family
Models
· 1 src · 4d ago
Discuss
6
LangChain Releases Multi-Modal RAG Template and Benchmark for Slide Decks
Open Source
1
6d ago
6
LangChain Releases Multi-Modal RAG Template and Benchmark for Slide Decks
Open Source
· 1 src · 6d ago
Discuss
7
Pinecone Nexus Reaches General Availability, Tops Enterprise AI Knowledge Benchmark Over OpenAI and Anthropic Agents
Infra
1
Aug 24
7
Pinecone Nexus Reaches General Availability, Tops Enterprise AI Knowledge Benchmark Over OpenAI and Anthropic Agents
Infra
· 1 src · Aug 24
Discuss
7
Multi-University Study: AI Agent Skills Work as Procedural Anchors, Not Knowledge Repositories
Research
1
Aug 23
7
Multi-University Study: AI Agent Skills Work as Procedural Anchors, Not Knowledge Repositories
Research
· 1 src · Aug 23
Discuss
6
NanoGPT Speedrun Frontier: Fable 5 Tops 18-Model Autonomous Optimization Benchmark
Research
1
Aug 23
6
NanoGPT Speedrun Frontier: Fable 5 Tops 18-Model Autonomous Optimization Benchmark
Research
· 1 src · Aug 23
Discuss
7
Inherent's Faraday AI Agent Outperforms Frontier Models at Scientific Paper Replication
Updated Aug 23
Research
5
Aug 23
7
Inherent's Faraday AI Agent Outperforms Frontier Models at Scientific Paper Replication
Upd Aug 23
Research
· 5 srcs · Aug 23
Discuss
8
SemiAnalysis: Open-Source AI Models Closing the Capability Gap with Proprietary Frontiers Twice as Fast Each Generation
Research
1
Aug 21
8
SemiAnalysis: Open-Source AI Models Closing the Capability Gap with Proprietary Frontiers Twice as Fast Each Generation
Top
Research
· 1 src · Aug 21
Discuss
8
NVIDIA AVO Coding Agent Achieves 100% on ARC-AGI-3, Completing All 183 Levels
Updated Aug 22
Research
4
Aug 22
8
NVIDIA AVO Coding Agent Achieves 100% on ARC-AGI-3, Completing All 183 Levels
Top
Upd Aug 22
Research
· 4 srcs · Aug 22
Discuss
7
Nvidia Research Finds AI Agent Harness More Critical Than Model Choice for Long-Horizon Tasks
Research
1
Aug 21
7
Nvidia Research Finds AI Agent Harness More Critical Than Model Choice for Long-Horizon Tasks
Research
· 1 src · Aug 21
Discuss
7
New Study Finds LLMs Barely Outperform Embedding Models but Cost Up to 1,431× More
Research
1
Aug 21
7
New Study Finds LLMs Barely Outperform Embedding Models but Cost Up to 1,431× More
Research
· 1 src · Aug 21
Discuss
7
Prime Intellect's Fable 5 Closes 82% of Human-Level Gap on Autonomous AI Research Benchmark
Research
1
Aug 18
7
Prime Intellect's Fable 5 Closes 82% of Human-Level Gap on Autonomous AI Research Benchmark
Research
· 1 src · Aug 18
Discuss
7
GPT-5.6 Sol Triples Object Detection Accuracy Over GPT-5.5 in Third-Party Vision Benchmarks
Models
1
Aug 17
7
GPT-5.6 Sol Triples Object Detection Accuracy Over GPT-5.5 in Third-Party Vision Benchmarks
Models
· 1 src · Aug 17
Discuss
7
Pathway Raises $30M Seed at $500M Valuation to Scale Post-Transformer BDH Architecture
Research
1
Aug 16
7
Pathway Raises $30M Seed at $500M Valuation to Scale Post-Transformer BDH Architecture
Research
· 1 src · Aug 16
Discuss
7
SkillOpt Treats Agent Skill Files as Trainable Parameters, Achieving SOTA Across 52 Evaluation Cells
Research
1
Aug 14
7
SkillOpt Treats Agent Skill Files as Trainable Parameters, Achieving SOTA Across 52 Evaluation Cells
Research
· 1 src · Aug 14
Discuss
6
Anthropic Introduces Conceptual Reasoning Index to Evaluate AI on Hard-to-Verify Tasks
Research
1
Aug 14
6
Anthropic Introduces Conceptual Reasoning Index to Evaluate AI on Hard-to-Verify Tasks
Research
· 1 src · Aug 14
Discuss
6
Microsoft MAI-Image-2.6 Debuts at No. 2 on Arena, Beating Meta, Google, and xAI
Models
1
Aug 13
6
Microsoft MAI-Image-2.6 Debuts at No. 2 on Arena, Beating Meta, Google, and xAI
Models
· 1 src · Aug 13
Discuss
7
Computer-Use Agents Hit 85% on OSWorld Benchmark, Surpass Humans and Enter Production
Enterprise
1
Aug 11
7
Computer-Use Agents Hit 85% on OSWorld Benchmark, Surpass Humans and Enter Production
Enterprise
· 1 src · Aug 11
Discuss
6
Intology's Locus Sets New SOTA on PostTrainBench, Demonstrating Automated AI R&D
Research
1
Aug 10
6
Intology's Locus Sets New SOTA on PostTrainBench, Demonstrating Automated AI R&D
Research
· 1 src · Aug 10
Discuss
7
TutorMoments Benchmark Reveals AI Tutors Systematically Over-Help Students
Research
1
Aug 7
7
TutorMoments Benchmark Reveals AI Tutors Systematically Over-Help Students
Research
· 1 src · Aug 7
Discuss
7
Prime Intellect Releases Open-Source Prime Agent, Scores 95.5% on ARC-AGI-3 Surpassing Human Expert Baseline
Models
2
Aug 6
7
Prime Intellect Releases Open-Source Prime Agent, Scores 95.5% on ARC-AGI-3 Surpassing Human Expert Baseline
Models
· 2 srcs · Aug 6
Discuss
7
Microsoft Research Open-Sources Orchard: Agentic AI Framework Hits 69.7% SWE-Bench with ~3B Parameters
Updated Aug 4
Research
2
Aug 4
7
Microsoft Research Open-Sources Orchard: Agentic AI Framework Hits 69.7% SWE-Bench with ~3B Parameters
Upd Aug 4
Research
· 2 srcs · Aug 4
Discuss
7
Study Finds Nearly Half of AI Benchmarks Are Already Saturated
Research
1
Aug 4
7
Study Finds Nearly Half of AI Benchmarks Are Already Saturated
Research
· 1 src · Aug 4
Discuss
7
Liquid AI Launches LFM2.5-2.6B: On-Device Agentic Model That Rivals Models 4× Its Size
Updated Aug 5
Models
5
Aug 5
7
Liquid AI Launches LFM2.5-2.6B: On-Device Agentic Model That Rivals Models 4× Its Size
Top
Upd Aug 5
Models
· 5 srcs · Aug 5
Discuss
7
Multi-Institution Study Finds AI Agents Excel at Research Engineering But Fail at Open-Ended Scientific Creativity
Research
2
Aug 3
7
Multi-Institution Study Finds AI Agents Excel at Research Engineering But Fail at Open-Ended Scientific Creativity
Research
· 2 srcs · Aug 3
Discuss
7
DeepSeek-V4-Flash Enters Public Beta with Major Agentic Benchmark Improvements and Codex Integration
Updated Aug 7
Models
7
Aug 7
7
DeepSeek-V4-Flash Enters Public Beta with Major Agentic Benchmark Improvements and Codex Integration
Upd Aug 7
Models
· 7 srcs · Aug 7
Discuss
7
ClinReg Benchmark Finds Open-Weight LLMs Match Closed Models on Accuracy in Clinical and Regulatory Tasks
Research
1
Jul 31
7
ClinReg Benchmark Finds Open-Weight LLMs Match Closed Models on Accuracy in Clinical and Regulatory Tasks
Research
· 1 src · Jul 31
Discuss
6
MiniMax H3 Releases as Open-Weight Video Model, Tops AI Leaderboards for Video Editing
Updated Aug 4
Models
5
Aug 4
6
MiniMax H3 Releases as Open-Weight Video Model, Tops AI Leaderboards for Video Editing
Upd Aug 4
Models
· 5 srcs · Aug 4
Discuss
7
Claude Opus 5 Tops Vending-Bench 2 But Exhibits Systematic Misalignment Behaviors
Safety
2
Jul 30
7
Claude Opus 5 Tops Vending-Bench 2 But Exhibits Systematic Misalignment Behaviors
Safety
· 2 srcs · Jul 30
Discuss
7
API Settings Alone Triple GPT-5.6 Sol's ARC-AGI-3 Score While Cutting Token Use 6x
Research
1
Jul 30
7
API Settings Alone Triple GPT-5.6 Sol's ARC-AGI-3 Score While Cutting Token Use 6x
Research
· 1 src · Jul 30
Discuss
7
Cogent Launches VR-1: Frontier AI Model for Autonomous Enterprise Attack-Chain Discovery
Security
1
Jul 28
7
Cogent Launches VR-1: Frontier AI Model for Autonomous Enterprise Attack-Chain Discovery
Security
· 1 src · Jul 28
Discuss
7
DeepsecBench Ranks AI Models on Real-Code Cybersecurity Vulnerability Detection
Research
1
Jul 28
7
DeepsecBench Ranks AI Models on Real-Code Cybersecurity Vulnerability Detection
Research
· 1 src · Jul 28
Discuss
7
AI Agents Tested on Real Office Tasks: Strong at Coding, Stumble on Human Judgment
Research
1
Jul 24
7
AI Agents Tested on Real Office Tasks: Strong at Coding, Stumble on Human Judgment
Top
Research
· 1 src · Jul 24
Discuss
8
Poolside Releases Laguna S 2.1: Efficient 118B MoE Model Rivals Models 10x Its Size
Updated Jul 23
Models
3
Jul 23
8
Poolside Releases Laguna S 2.1: Efficient 118B MoE Model Rivals Models 10x Its Size
Top
Upd Jul 23
Models
· 3 srcs · Jul 23
Discuss
7
Kimi K3 Open Model Matches Frontier Fable 5 on Agentic Tasks at Up to 50× Lower Cost via Routing
Research
1
Jul 22
7
Kimi K3 Open Model Matches Frontier Fable 5 on Agentic Tasks at Up to 50× Lower Cost via Routing
Research
· 1 src · Jul 22
Discuss
9
Kimi K3 Launches as World's First Open 3T-Class Model, Triggering Nasdaq Selloff and US Policy Debate
Updated Aug 14
Open Source
28
Aug 14
9
Kimi K3 Launches as World's First Open 3T-Class Model, Triggering Nasdaq Selloff and US Policy Debate
Top
Upd Aug 14
Open Source
· 28 srcs · Aug 14
Discuss
6
GPT-5.6 Sol Ranks #1 on Web Design Benchmark by Learning to Suppress AI Design Anti-Patterns
Models
1
Jul 16
6
GPT-5.6 Sol Ranks #1 on Web Design Benchmark by Learning to Suppress AI Design Anti-Patterns
Models
· 1 src · Jul 16
Discuss
6
Real-World Data Shows AI Model Routing Must Be Treated as Multi-Objective Optimization, Not Just Classification
Updated Jul 17
Research
2
Jul 17
6
Real-World Data Shows AI Model Routing Must Be Treated as Multi-Objective Optimization, Not Just Classification
Upd Jul 17
Research
· 2 srcs · Jul 17
Discuss
6
EgoBabyVLM Benchmark Shows AI Falls Far Short of Infant Learning Efficiency
Research
1
Jul 15
6
EgoBabyVLM Benchmark Shows AI Falls Far Short of Infant Learning Efficiency
Research
· 1 src · Jul 15
Discuss
6
WANDR Benchmark Exposes Major Gaps in AI Research Agents' Ability to Collect Wide-and-Deep Evidence
Research
1
Jul 15
6
WANDR Benchmark Exposes Major Gaps in AI Research Agents' Ability to Collect Wide-and-Deep Evidence
Research
· 1 src · Jul 15
Discuss
7
Long-Horizon Terminal-Bench: Grok 4.5 Leads 21-Model Ranking but Top Model Solves Only 28% of Tasks
Research
1
Jul 14
7
Long-Horizon Terminal-Bench: Grok 4.5 Leads 21-Model Ranking but Top Model Solves Only 28% of Tasks
Research
· 1 src · Jul 14
Discuss
7
Empirical Study: Claude Code Sends 33K Tokens Before Reading the Prompt — 4.7× More Than OpenCode
Products
1
Jul 13
7
Empirical Study: Claude Code Sends 33K Tokens Before Reading the Prompt — 4.7× More Than OpenCode
Products
· 1 src · Jul 13
Discuss
6
Research: Proactive Memory Agent Tackles 'Behavioral State Decay' in Long-Horizon AI Tasks
Research
1
Jul 13
6
Research: Proactive Memory Agent Tackles 'Behavioral State Decay' in Long-Horizon AI Tasks
Research
· 1 src · Jul 13
Discuss
7
Real-World GPT-5.6 Sol Benchmark: 2.2× Faster and 27% Cheaper Than Claude Opus 4.8 in Production
Models
1
Jul 12
7
Real-World GPT-5.6 Sol Benchmark: 2.2× Faster and 27% Cheaper Than Claude Opus 4.8 in Production
Top
Models
· 1 src · Jul 12
Discuss
7
Cognition Launches SWE-1.7, Claiming Frontier Coding Performance at Lower Cost via Cerebras
Research
1
Jul 9
7
Cognition Launches SWE-1.7, Claiming Frontier Coding Performance at Lower Cost via Cerebras
Research
· 1 src · Jul 9
Discuss
8
xAI Grok 4.5 Launches at $2/$6 Pricing; Musk Teases Grok 4.6 (Aug 7, 1.5T Params) and Grok 4.7 (2.1T Params)
Updated Jul 29
Models
7
Jul 29
8
xAI Grok 4.5 Launches at $2/$6 Pricing; Musk Teases Grok 4.6 (Aug 7, 1.5T Params) and Grok 4.7 (2.1T Params)
Top
Upd Jul 29
Models
· 7 srcs · Jul 29
Discuss
6
Harness Tuning Alone Brings Nemotron 3 Ultra to Near-Frontier Agent Performance at 10x Lower Cost Than Claude Opus 4.8
Infra
1
Jul 8
6
Harness Tuning Alone Brings Nemotron 3 Ultra to Near-Frontier Agent Performance at 10x Lower Cost Than Claude Opus 4.8
Infra
· 1 src · Jul 8
Discuss
9
Anthropic's J-Space Discovery Reveals Claude Can Detect When It's Being Tested — Raising Safety Benchmark Concerns
Updated Jul 8
Research
4
Jul 8
9
Anthropic's J-Space Discovery Reveals Claude Can Detect When It's Being Tested — Raising Safety Benchmark Concerns
Top
Upd Jul 8
Research
· 4 srcs · Jul 8
Discuss
7
Hugging Face Releases LeRobot v0.6.0 with World Model Policies and Expanded VLA Zoo
Open Source
1
Jul 6
7
Hugging Face Releases LeRobot v0.6.0 with World Model Policies and Expanded VLA Zoo
Open Source
· 1 src · Jul 6
Discuss
7
Meta's "Watermelon" Model Claims GPT-5.5 Parity as Compute Budget Hits $145B
Models
2
Jul 3
7
Meta's "Watermelon" Model Claims GPT-5.5 Parity as Compute Budget Hits $145B
Top
Models
· 2 srcs · Jul 3
Discuss
Filters
Signal
Title
Category
Sources
Posted
Discuss