shipfeedAI news, curated daily

21:48:49 CET
13 AUG21:48:49shipfeed
pull to refreshlast sync
Just in — 8 new
§ topic

evals

32 stories · 7d·6 sources covering·30 active storylines

Updated Wed, 12 Aug 2026 CEST·32 new storylines this week·live

What this is

Evals are the benchmarks and tests that measure how AI models perform on reasoning, coding, and safety tasks. shipfeed tracks new benchmark releases and notable evaluation results.

storylines this week30 active

Thursday, July 30, 2026’s edition
Friday, July 24, 2026’s edition
Sunday, July 26, 2026’s edition
Tuesday, July 21, 2026’s edition
Saturday, July 18, 2026’s edition
Friday, July 17, 2026’s edition
Friday, July 10, 2026’s edition
Tuesday, June 30, 2026’s edition
Thursday, June 18, 2026’s edition
Monday, June 8, 2026’s edition
Tuesday, June 2, 2026’s edition
Thursday, May 28, 2026’s edition
Saturday, May 16, 2026’s edition
Wednesday, May 13, 2026’s edition
AI Security Institute
SAFETY · 1 source

Mythos Preview first to complete both AISI cyber ranges

AI Security Institute: Mythos Preview is the first AI model to complete both of AISI's cyber ranges, which measure models' cyberattack capabilities; GPT-5.5 solved only one of them — In February 2026, we internally…

via techmeme.com
Tuesday, August 11, 2026’s edition
Monday, August 10, 2026’s edition
Thursday, August 6, 2026’s edition
Wednesday, August 5, 2026’s edition
Tuesday, August 4, 2026’s edition
Monday, August 3, 2026’s edition
Sunday, August 2, 2026’s edition
Friday, July 31, 2026’s edition
Wednesday, July 29, 2026’s edition