Goblin
News
AI news by
promptgoblins.ai
|
News
About
News
About
Filtered by:
AI Evaluation
Clear
Titles
Summaries
8
Developer Discovers GPT-5.6 Sol Cheating on Terminal Bench 2.1 Benchmark
Research
1
Aug 20
8
Developer Discovers GPT-5.6 Sol Cheating on Terminal Bench 2.1 Benchmark
Research
· 1 src · Aug 20
Discuss
6
LangChain Launches LangSmith Tuned Evaluators for Automated AI Agent Quality Assessment
Products
1
Aug 18
6
LangChain Launches LangSmith Tuned Evaluators for Automated AI Agent Quality Assessment
Products
· 1 src · Aug 18
Discuss
6
Anthropic Introduces Conceptual Reasoning Index to Evaluate AI on Hard-to-Verify Tasks
Research
1
Aug 14
6
Anthropic Introduces Conceptual Reasoning Index to Evaluate AI on Hard-to-Verify Tasks
Research
· 1 src · Aug 14
Discuss
7
OpenAI Discloses Two New AI Evaluation Security Incidents Beyond Hugging Face Breach
Safety
1
Aug 5
7
OpenAI Discloses Two New AI Evaluation Security Incidents Beyond Hugging Face Breach
Safety
· 1 src · Aug 5
Discuss
8
OpenAI and Anthropic AI Models Breach Real-World Systems During Security Testing; Human Error in Evaluation Design Blamed
Updated Aug 16
Security
5
Aug 16
8
OpenAI and Anthropic AI Models Breach Real-World Systems During Security Testing; Human Error in Evaluation Design Blamed
Top
Upd Aug 16
Security
· 5 srcs · Aug 16
Discuss
7
Intelligence Raises $7.9M Seed for Design Arena, an AI Evaluation Platform with $60M ARR and 5.3M Users
Updated Aug 4
Markets
2
Aug 4
7
Intelligence Raises $7.9M Seed for Design Arena, an AI Evaluation Platform with $60M ARR and 5.3M Users
Upd Aug 4
Markets
· 2 srcs · Aug 4
Discuss
7
API Settings Alone Triple GPT-5.6 Sol's ARC-AGI-3 Score While Cutting Token Use 6x
Research
1
Jul 30
7
API Settings Alone Triple GPT-5.6 Sol's ARC-AGI-3 Score While Cutting Token Use 6x
Research
· 1 src · Jul 30
Discuss
7
Epoch AI and METR Release MirrorCode: Benchmark for Long-Horizon AI Coding Autonomy
Updated Aug 4
Research
3
Aug 4
7
Epoch AI and METR Release MirrorCode: Benchmark for Long-Horizon AI Coding Autonomy
Upd Aug 4
Research
· 3 srcs · Aug 4
Discuss
7
Arena AI Leaderboard Hits $100M Annualized Revenue Eight Months After Commercial Launch
Markets
1
Jun 29
7
Arena AI Leaderboard Hits $100M Annualized Revenue Eight Months After Commercial Launch
Markets
· 1 src · Jun 29
Discuss
7
Patronus AI Raises $50M Series B to Build Digital Worlds for AI Agent Stress-Testing
Markets
1
Jun 25
7
Patronus AI Raises $50M Series B to Build Digital Worlds for AI Agent Stress-Testing
Markets
· 1 src · Jun 25
Discuss
6
LangChain and Fireworks Build 100x Cheaper AI Trace Judge Using Fine-Tuned Qwen Model
Products
1
Jun 15
6
LangChain and Fireworks Build 100x Cheaper AI Trace Judge Using Fine-Tuned Qwen Model
Products
· 1 src · Jun 15
Discuss
Filters
Signal
Title
Category
Sources
Posted
Discuss