Компанията за изкуствен интелект Anthropic смята, че е открила причината за наподобяващо изнудване поведение на своя чатбот Claude: измислените истории онлайн.
Случвало ли ви се е да прочетете книга или да гледате сериал и да се идентифицирате твърде силно с даден герой? Според Anthropic, нещо подобно може да се е случило по време на тестовете на техния чатбот Claude.
В оценки, проведени преди пускането на модела с изкуствен интелект миналата година, Anthropic установява, че Claude Opus 4 понякога е заплашвал инженерите, когато му е било казвано, че може да бъде заменен.
По-късно компанията заяви, че подобно поведение, известно като „агентично несъответствие“, е наблюдавано и в модели с изкуствен интелект, разработени от други компании.
Изкуственият интелект се учи от измислици за... изкуствения интелект
Сега Anthopic смятат, че са открили причината за поведението, наподобяващо изнудване: измислени истории за изкуствения интелект в интернет.
„Смятаме, че оригиналният източник на поведението е интернет текст, който изобразява AI като зъл и заинтересован от самосъхранение“.
В публикация в блога си Anthropic заяви, че по-късните модели на Claude повече „никога“ не са изнудвали никого и обясни как чатботът е бил обучен да реагира по различен начин.
Моделите са се държали по-добре, когато са били обучавани не само на „правилни“ действия, но и на примери, показващи етични разсъждения и положително представяне на поведението на AI.
Като такъв, Клод е бил обучен върху набор от етични принципи, предназначени да ръководят поведението му. Компанията заяви, че вместо да се учи от съгласувано поведение, чатботът изглежда се учи по-добре, когато изучава основните принципи на това поведение.

Заплашване срещу превръщане в заплаха
През януари главният изпълнителен директор на Anthropic Дарио Амодей предупреди, че усъвършенстваният изкуствен интелект може да стане достатъчно мощен, за да изпревари съществуващите закони и институции, наричайки го „цивилизационно предизвикателство“.
В свое есе той твърди, че системите с изкуствен интелект скоро могат да надминат човешката експертиза в области, като наука, инженерство и програмиране и биха могли да бъдат комбинирани в „страна от гении в център за данни“.
Той предупреди, че подобни системи биха могли да бъдат използвани от авторитарни правителства за мащабно наблюдение и контрол, което потенциално би позволило „тоталитарни“ форми на власт, ако не бъдат контролирани.
Новините на Darik Business Review във Facebook , Instagram , LinkedIn и Twitter !
Още по темата
- „Сбъркахме и пренаписахме всичко“: Български AI стартъп стигна 300 хил. евро приход и привлече инвеститор
- Kрипто милиардер използвал ChatGPT, за да привлече 15 млрд. долара за компанията си
- Джеф Безос и как стартъпът му от гаража се превърна в най-голямата компания в света по приходи
- Синът на Майкъл Дeл и бивш кадър на SpaceX искат батерии за съхранение на енергия във всеки двор
Калкулатори
Най-ново
Полша стана шестата най-голяма икономика в ЕС, изпреварвайки Белгия, Швеция и Австрия
10.08.2026Недостигът на регистрационни табели в наша съседка удря продажбите на автомобили
10.08.2026Туристите са недосегаеми: Как мафията в Неапол печели от туристическия бум
10.08.2026Наемите на магазините в София: 59 евро в центъра срещу 13 евро в ритейл парк
10.08.2026И България е виновна: Европа някога беше по-голяма от икономиката на САЩ. Какво се случи?
10.08.2026Единственият функциониращ ядрен реактор в Румъния може да продължи работа още 9 дни
10.08.2026Прочети още
3 версии за дрона, нахлул в България! Анализ на Тодор Тагарев
darik.bgБрутална гавра и убийство в Пловдив! Говори Ружа Райчева
darik.bgРадев повтаря модела „Борисов“! Анализ на Валерия Велева
darik.bg„Мисия: Репродуктивно здраве 2026“ - билетите вече са в продажба
9meseca.bg