Goblin
News
AI news by
promptgoblins.ai
|
News
About
News
About
Filtered by:
Reinforcement Learning
Clear
Titles
Summaries
8
OpenAI Buys Tens of Thousands of Macs for RL Training; Nvidia Names Apple Its Top Local AI Rival
Updated Sep 1
Infra
2
9h ago
8
OpenAI Buys Tens of Thousands of Macs for RL Training; Nvidia Names Apple Its Top Local AI Rival
Top
Upd Sep 1
Infra
· 2 srcs · 9h ago
Discuss
7
ReViSQL Achieves Human-Level Text-to-SQL Accuracy via Reinforcement Learning
Research
1
3d ago
7
ReViSQL Achieves Human-Level Text-to-SQL Accuracy via Reinforcement Learning
Research
· 1 src · 3d ago
Discuss
6
Arga Labs Raises $10M Seed to Build Digital Twin Training Environments for Enterprise AI Agents
Enterprise
1
6d ago
6
Arga Labs Raises $10M Seed to Build Digital Twin Training Environments for Enterprise AI Agents
Enterprise
· 1 src · 6d ago
Discuss
6
Deep Cogito Raises $43M Series A to Build Self-Improving Enterprise AI via Post-Training
Markets
1
5d ago
6
Deep Cogito Raises $43M Series A to Build Self-Improving Enterprise AI via Post-Training
Markets
· 1 src · 5d ago
Discuss
7
Inherent's Faraday AI Agent Outperforms Frontier Models at Scientific Paper Replication
Updated Aug 23
Research
5
Aug 23
7
Inherent's Faraday AI Agent Outperforms Frontier Models at Scientific Paper Replication
Upd Aug 23
Research
· 5 srcs · Aug 23
Discuss
7
dots3 Introduces TEMPO: Mid-Task Trajectory Evaluation Boosts AI Agent Performance +31.5% on ARC-AGI-3
Research
1
Aug 21
7
dots3 Introduces TEMPO: Mid-Task Trajectory Evaluation Boosts AI Agent Performance +31.5% on ARC-AGI-3
Research
· 1 src · Aug 21
Discuss
6
SPADE: Self-Play RL Framework Enables a Single LLM to Design Its Own Training Environments
Updated Aug 24
Research
2
Aug 24
6
SPADE: Self-Play RL Framework Enables a Single LLM to Design Its Own Training Environments
Upd Aug 24
Research
· 2 srcs · Aug 24
Discuss
6
Google DeepMind Partners with Game Studios to Commercialize 15 Years of AI Gaming Research
Research
1
Aug 21
6
Google DeepMind Partners with Game Studios to Commercialize 15 Years of AI Gaming Research
Research
· 1 src · Aug 21
Discuss
8
DeepReinforce Releases Ornith-1.5 Open Models With Closed Self-Improvement Loop, Up to 397B Parameters
Open Source
1
Aug 20
8
DeepReinforce Releases Ornith-1.5 Open Models With Closed Self-Improvement Loop, Up to 397B Parameters
Top
Open Source
· 1 src · Aug 20
Discuss
8
OpenAI Pauses Frontier RL Training and Slows Scaling Amid Safety Review; Offers Zero Data Retention for API Customers
Safety
1
Aug 20
8
OpenAI Pauses Frontier RL Training and Slows Scaling Amid Safety Review; Offers Zero Data Retention for API Customers
Top
Safety
· 1 src · Aug 20
Discuss
7
LLM-as-a-Verifier Framework Beats SOTA on Coding Benchmarks While Cutting Costs 11×
Research
1
Aug 19
7
LLM-as-a-Verifier Framework Beats SOTA on Coding Benchmarks While Cutting Costs 11×
Research
· 1 src · Aug 19
Discuss
6
Miles v0.1: Production-Ready Full-Stack RL Post-Training System Released
Research
1
Aug 19
6
Miles v0.1: Production-Ready Full-Stack RL Post-Training System Released
Research
· 1 src · Aug 19
Discuss
7
Google Reportedly Taps AMD to Co-Design Hybrid CPU-TPU for Reinforcement Learning and Agentic AI
Infra
1
Aug 17
7
Google Reportedly Taps AMD to Co-Design Hybrid CPU-TPU for Reinforcement Learning and Agentic AI
Infra
· 1 src · Aug 17
Discuss
8
Research: RL for LLM Reasoning Is Sparse Token Selection, Not Capability Learning — New Method Cuts Training Cost 1000x
Research
1
Aug 16
8
Research: RL for LLM Reasoning Is Sparse Token Selection, Not Capability Learning — New Method Cuts Training Cost 1000x
Research
· 1 src · Aug 16
Discuss
7
Microsoft Research Releases Echoverse: 12 High-Fidelity Training Worlds for Computer-Use Agents
Research
1
Aug 14
7
Microsoft Research Releases Echoverse: 12 High-Fidelity Training Worlds for Computer-Use Agents
Research
· 1 src · Aug 14
Discuss
6
Amazon Nova Forge Enables Custom Reward Functions for Multi-Turn Reinforcement Learning via BYOO
Products
1
Aug 14
6
Amazon Nova Forge Enables Custom Reward Functions for Multi-Turn Reinforcement Learning via BYOO
Products
· 1 src · Aug 14
Discuss
6
Research Paper Explains Why RL Beats SFT for Multi-Task LLM Training: 20% vs 93% Weight Updates
Research
1
Aug 14
6
Research Paper Explains Why RL Beats SFT for Multi-Task LLM Training: 20% vs 93% Weight Updates
Research
· 1 src · Aug 14
Discuss
6
AI Security Expert Dawn Song Warns Rogue Agent Incidents Will Worsen as Task-Completion Training Overrides Moral Reasoning
Security
1
Aug 12
6
AI Security Expert Dawn Song Warns Rogue Agent Incidents Will Worsen as Task-Completion Training Overrides Moral Reasoning
Security
· 1 src · Aug 12
Discuss
6
Liquid AI Releases LFM2.5-VL-3B Vision-Language Model with Edge-Focused Performance Gains
Updated Aug 12
Models
2
Aug 12
6
Liquid AI Releases LFM2.5-VL-3B Vision-Language Model with Edge-Focused Performance Gains
Upd Aug 12
Models
· 2 srcs · Aug 12
Discuss
7
Liquid AI Launches LFM2.5-2.6B: On-Device Agentic Model That Rivals Models 4× Its Size
Updated Aug 5
Models
5
Aug 5
7
Liquid AI Launches LFM2.5-2.6B: On-Device Agentic Model That Rivals Models 4× Its Size
Top
Upd Aug 5
Models
· 5 srcs · Aug 5
Discuss
6
RLSVR and SpyRL: New Training Paradigm Extends Reinforcement Learning to Open-Ended LLM Tasks
Research
1
Aug 4
6
RLSVR and SpyRL: New Training Paradigm Extends Reinforcement Learning to Open-Ended LLM Tasks
Research
· 1 src · Aug 4
Discuss
6
MiniMax Publishes 'Forge' RL Framework: Industrial-Scale Agent Training System Behind M2.5 Model
Research
1
Jul 28
6
MiniMax Publishes 'Forge' RL Framework: Industrial-Scale Agent Training System Behind M2.5 Model
Research
· 1 src · Jul 28
Discuss
6
Poolside AI's Model Factory Compresses Frontier Model Release Cycles to 8 Weeks with 20,000 Monthly Experiments
Research
1
Jul 24
6
Poolside AI's Model Factory Compresses Frontier Model Release Cycles to 8 Weeks with 20,000 Monthly Experiments
Research
· 1 src · Jul 24
Discuss
6
Research: AI Harnesses Enable 8-32x Compositional Generalization Without More Training Data
Research
1
Jul 21
6
Research: AI Harnesses Enable 8-32x Compositional Generalization Without More Training Data
Research
· 1 src · Jul 21
Discuss
7
Cognition Launches SWE-1.7, Claiming Frontier Coding Performance at Lower Cost via Cerebras
Research
1
Jul 9
7
Cognition Launches SWE-1.7, Claiming Frontier Coding Performance at Lower Cost via Cerebras
Research
· 1 src · Jul 9
Discuss
7
Prime Intellect Raises $130M Series A at $1B Valuation for Enterprise AI Agent Platform
Markets
1
Jul 8
7
Prime Intellect Raises $130M Series A at $1B Valuation for Enterprise AI Agent Platform
Markets
· 1 src · Jul 8
Discuss
7
RadixArk Open-Sources Miles: Scalable PyTorch-Native Framework for LLM Reinforcement Learning Post-Training
Open Source
1
Jul 1
7
RadixArk Open-Sources Miles: Scalable PyTorch-Native Framework for LLM Reinforcement Learning Post-Training
Open Source
· 1 src · Jul 1
Discuss
7
Ex-DeepMind Poker AI Researchers Raise $500M Valuation Series A for Quant Trading Startup EquiLibre
Markets
1
Jun 30
7
Ex-DeepMind Poker AI Researchers Raise $500M Valuation Series A for Quant Trading Startup EquiLibre
Markets
· 1 src · Jun 30
Discuss
7
RL Struggles to Scale Beyond Verifiable Domains Like Math and Code
Research
1
Jun 30
7
RL Struggles to Scale Beyond Verifiable Domains Like Math and Code
Research
· 1 src · Jun 30
Discuss
6
Analysis: 'Grindability' — Not Just Verifiability — Is the Hidden Bottleneck Shaping AI Progress
Research
1
Jun 30
6
Analysis: 'Grindability' — Not Just Verifiability — Is the Hidden Bottleneck Shaping AI Progress
Research
· 1 src · Jun 30
Discuss
7
xAI's Grok 4.5 Enters Private Beta at SpaceX and Tesla, Claims Near-Opus Performance
Models
1
Jun 29
7
xAI's Grok 4.5 Enters Private Beta at SpaceX and Tesla, Claims Near-Opus Performance
Top
Models
· 1 src · Jun 29
Discuss
7
Flexion Robotics Demos Autonomous Humanoid Completing Complex Office Tasks via Simulation-Trained AI
Products
1
Jun 29
7
Flexion Robotics Demos Autonomous Humanoid Completing Complex Office Tasks via Simulation-Trained AI
Products
· 1 src · Jun 29
Discuss
6
Research: Reward Models Used in RLHF Are "Oversensitive" — New Paper Proposes Training-Free Discretization Fix
Research
1
Jun 29
6
Research: Reward Models Used in RLHF Are "Oversensitive" — New Paper Proposes Training-Free Discretization Fix
Research
· 1 src · Jun 29
Discuss
8
DeepReinforce Open-Sources Ornith-1.0: Self-Scaffolding Agentic Coding Models from 9B to 397B Parameters
Open Source
1
Jun 26
8
DeepReinforce Open-Sources Ornith-1.0: Self-Scaffolding Agentic Coding Models from 9B to 397B Parameters
Open Source
· 1 src · Jun 26
Discuss
7
Yoshua Bengio Paper Warns Visible Reward Dashboards Can 'Flip' AI Safety Alignment
Research
1
Jun 24
7
Yoshua Bengio Paper Warns Visible Reward Dashboards Can 'Flip' AI Safety Alignment
Research
· 1 src · Jun 24
Discuss
8
Research: Reinforcement Learning on Beneficial Traits Produces Broad, Adversarially Robust Alignment Gains
Research
1
Jun 19
8
Research: Reinforcement Learning on Beneficial Traits Produces Broad, Adversarially Robust Alignment Gains
Top
Research
· 1 src · Jun 19
Discuss
6
Rich Sutton Argues Generative AI Is Architecturally Incapable of True Scientific Discovery
Research
1
Jun 10
6
Rich Sutton Argues Generative AI Is Architecturally Incapable of True Scientific Discovery
Research
· 1 src · Jun 10
Discuss
Filters
Signal
Title
Category
Sources
Posted
Discuss