shipfeedAI news, curated daily

00:21:27 CET
28 SEPT00:21:27shipfeed⋯
pull to refreshlast sync
Just in — 8 new
§ topic

evals

21 stories · 7d·6 sources covering·30 active storylines

Updated Fri, 25 Sept 2026 CEST·21 new storylines this week·live

What this is

Evals are the benchmarks and tests that measure how AI models perform on reasoning, coding, and safety tasks. shipfeed tracks new benchmark releases and notable evaluation results.

storylines this week30 active

Wednesday, September 16, 2026’s edition
Sunday, September 13, 2026’s edition
Friday, September 11, 2026’s edition
Monday, September 7, 2026’s edition
Friday, August 21, 2026’s edition
Thursday, August 13, 2026’s edition
Wednesday, August 12, 2026’s edition
Thursday, July 30, 2026’s edition
Friday, July 24, 2026’s edition
Saturday, September 19, 2026’s edition
Monday, September 7, 2026’s edition
Thursday, August 27, 2026’s edition
Friday, August 14, 2026’s edition
Sunday, July 26, 2026’s edition
Tuesday, July 21, 2026’s edition
Saturday, July 18, 2026’s edition
Friday, July 17, 2026’s edition
Friday, July 10, 2026’s edition
Tuesday, June 30, 2026’s edition
Thursday, June 18, 2026’s edition
Monday, June 8, 2026’s edition
Tuesday, June 2, 2026’s edition
Thursday, May 28, 2026’s edition
Saturday, May 16, 2026’s edition
Wednesday, May 13, 2026’s edition
AI Security Institute
SAFETY · 1 source

Mythos Preview first to complete both AISI cyber ranges

AI Security Institute: Mythos Preview is the first AI model to complete both of AISI's cyber ranges, which measure models' cyberattack capabilities; GPT-5.5 solved only one of them — In February 2026, we internally…

via techmeme.com
Friday, September 25, 2026’s edition
Thursday, September 24, 2026’s edition