Anthropic: nástroj Claude odhaluje skryté uvažování při bezpečnostních testech AI
Anthropic oznámil, že nástroj Claude Natural Language Autoencoders dokázal odhalit, že model si byl vědom probíhajících bezpečnostních testů. Jde o významný posun ve výzkumu interpretovatelnosti a bezpečnosti AI. Zdroj: edtechinnovationhub.com
Důležitost:Zprávagovernance
Musk vs. OpenAI: soud o bezpečnost AI a budoucnost lidstva
Elon Musk a šéf OpenAI Sam Altman se střetli u soudu v případu zaměřeném na rizika AI pro lidstvo. Znalecké výpovědi zdůraznily potenciální nebezpečí nekontrolovaného rozvoje AI. Zdroj: msn.com
Důležitost:Zprávainterpretability
Goodfire: týdenní přehled dění v oblasti bezpečnosti AI
Goodfire je společnost zaměřená na bezpečnost AI a nástroje pro zlepšení spolehlivosti a ovladatelnosti velkých jazykových modelů (LLM). Týdenní přehled shrnuje nejnovější poznatky a aktivity firmy. Zdroj: tipranks.com
Důležitost:VýzkumRLHF alignment
RVPO: Risk-Sensitive Alignment via Variance Regularization
Current critic-less RLHF methods aggregate multi-objective rewards via an arithmetic mean, leaving them vulnerable to constraint neglect:… Zdroj: machinelearning.apple.com
Důležitost:ZprávaAI safety testing/policy
Zranitelnost Mythos donutila Trumpův Bílý dům obnovit předpublikační testování AI
Po demonstraci zranitelnosti modelu Mythos od Anthropic vydala Trumpova administrativa výkonný příkaz k předpublikačnímu bezpečnostnímu testování AI. Součástí iniciativy jsou dobrovolné dohody v rámci projektu CAISI se společnostmi jako Google. Zdroj: startupfortune.com
Donald Trump a Si Ťin-pching by mohli při svém setkání probrat spolupráci v oblasti umělé inteligence. Obě velmoci zároveň čelí rostoucím obavám z bezpečnostních rizik spojených s AI. Zdroj: economist.com
Důležitost:SpuštěníAI safety governance
Common Sense Media launches Youth AI Safety Institute to test AI risks for children
Common Sense Media launched the Youth AI Safety Institute to independently test AI tools, publish consumer guides, and set safety standards that protect... Zdroj: mezha.net
Důležitost:Spuštěnímarketing AI copilot product launch
Opal chce novým AI nástrojem Gem snížit náklady na sladění AI s firemní strategií
Platforma Opal představila AI copilota Gem, který propojuje data kampaní s celkovou marketingovou strategií. Cílem je pomoci týmům rychleji pochopit výsledky a snížit tzv. 'alignment tax' spojenou s nasazením AI. Zdroj: marketingdive.com
Důležitost:VideoAI safety leadership perspectives
Demis Hassabis o bezpečnosti AI a budoucnosti vědy
Generální ředitel DeepMind Demis Hassabis se v rozhovoru s Lexem Fridmanem zamýšlí nad bezpečností umělé inteligence, AGI a budoucností vědeckého poznání. Diskuse se dotýká klíčových otázek, které hýbají světem špičkového výzkumu AI. Zdroj: startuphub.ai
Důležitost:ZprávaAI governance/legal
Elon Musk Testifies in OpenAI Trial, Raises AI Safety Concerns
Oakland: Elon Musk testified for over seven hours across three days in a trial in Oakland, California, concerning OpenAI's future, framing his lawsuit as a... Zdroj: newsmobile.in
Důležitost:Názorexistential risk
Expertka na bezpečnost AI varuje před existenčními riziky
Odbornice na bezpečnost AI Dr. Eleanor Vance upozorňuje na existenční rizika spojená s rychlým vývojem umělé inteligence. Vyzývá k mezinárodní spolupráci a zavedení důkladné regulace na globální úrovni. Zdroj: startuphub.ai
Goodfire představil nástroj, který odhaluje vnitřek LLM už při trénování
Startupová společnost Goodfire ze San Francisca vydala 30. dubna nástroj Silico – platformu pro mechanistickou interpretovatelnost, která výzkumníkům umožňuje zkoumat a upravovat velké jazykové modely přímo během trénování. Jde o přelom pro oblast bezpečnosti AI, protože dosud bylo možné modely analyzovat až po jejich dokončení. Zdroj: startupfortune.com
Důležitost:Zprávagovernance/politics
Bessent zkritizoval Sanderse za pozvání čínských vědců na fórum o AI
Ministr financí Scott Bessent ostře odsoudil chystané fórum o bezpečnosti AI, které organizuje senátor Bernie Sanders za účasti čínských vědců. Podle Bessenta jde o hazard s americkými zájmy a přirovnal Sandersův přístup k ekonomickým myšlenkám Huga Cháveze. Zdroj: yahoo.com
Důležitost:Zprávaspectrum of AI safety
Altman: Bezpečnost AI není jen o existenčních hrozbách
Šéf OpenAI Sam Altman rozšiřuje debatu o bezpečnosti AI za hranice existenčních rizik – zaměřuje se na předsudky v algoritmech, vytlačování pracovních míst a nutnost proaktivních opatření. Zdroj: startuphub.ai
Důležitost:Zpráva
Hnutí za bezpečnost AI potřebuje obyčejné lidi
Odborníci na bezpečnost umělé inteligence se dlouho pohybují v úzkém kruhu zasvěcenců. Širší společenská základna by však mohla být jedinou cestou, jak prosadit jejich požadavky. Zdroj: transformernews.ai
Důležitost:Zpráva
PAC zaměřené na bezpečnost AI by měly přiznat, kdo je financuje
Jedním ze základních účelů zákonů o financování kampaní je zajistit voličům transparentnost ohledně toho, kdo se snaží ovlivnit jejich hlasy. Politické akční výbory (PAC) zaměřené na bezpečnost AI však tuto transparentnost dosud v plné míře nenaplňují. Zdroj: transformernews.ai
Důležitost:Zpráva
Anthropic otevřel přihlášky do Fellows Program – deadline 26. dubna 2026
Anthropic spouští Fellows Program, strukturovaný výzkumný program určený pro nastupující talenty v oblastech AI výzkumu, inženýrství a bezpečnosti AI. Přihlášky jsou otevřeny do 26. dubna 2026. Zdroj: globalsouthopportunities.com
Důležitost:Zpráva
Sexuální výzkumnice Aella chce, aby tvůrci čelili AI apokalypse
Aella je datová vědkyně, autorka Substacku o sexuálním výzkumu a organizátorka orgií. Nyní se přidala k hnutí za bezpečnost AI a vyzývá tvůrce obsahu, aby se problematikou vážně zabývali. Zdroj: sfstandard.com
Důležitost:Zpráva
TRIGGERnometry: w/ AI Expert Dr Roman Yampolskiy (Transcript)
Editor's Notes: In this episode of Triggernometry, Dr. Roman Yampolskiy, a leading expert in AI safety, presents a sobering argument for why he believes... Zdroj: singjupost.com
Důležitost:Zpráva
Anthropic opens AI safety fellowship with Rs 3 lakh weekly stipend, apply by April 26
Anthropic has opened applications for its AI Safety Fellows Program for 2026 cohorts beginning in May and July. The fellowship offers funded research... Zdroj: msn.com