bob робот косячит :
не смог маленькую посылочку положить вниз этикеткой ...
подгорело маленько от хайроллера , реги не выигрывают турниры :
структуры ужасные : в 30 кушах стеках разыгрываем половину призового
буэ
но есть такое вуп вуп
+70к
недобрал 140к) за второе эх)
про трейдинг, многие хотят победить полимаркет или другой очень сложный рынок, но там оч крутые боссы
как стать боссом чел описал
у них основной солвер это Gurobi за 200к $ в год
если совсем грубо: они просчитывают все возможные варианты портфелей и стратегий а потом могут ГТО выбрать для своих инвестиций...
новостя
из интересного Самоэволюция :
вот такие у них результаты
статья-саммари:
самое интересное как это работает :
отдельно слежу за Mythos, скоро станет общедоступным по слухам :
а пока да здравствует этот дырявый мир :
к gpt-5.5 cyber доступ публичный, нужно только пройти верификацию у них на сайте
очевидно находятся уязвимости быстрее чем закрываются
я бы больше сказал уязвимости кодогенерируются быстрее чем находяться ) и тем более закрываются )
про даты
первый пошел
странно зачем они такое в опенсорс выкладывают ...
опасная штука...
источники:
кратко как работает: берут нейросеть открытую oss 120b
ставят задачу, получают первые экспериментальные данные , на этих данных! дообучают модель !
далее снова ставят задачу получают эксперимент далее снова дообучают модель )
запекают опыт в веса модели
и так модель общего назначения впитывает специфичный опыт конкретной задачи)
эволюционная нейросеть получается ...
т.е. научили нейросеть новым навыкам)
новый формат императора это топ
чел подумал что это холдем))) велком
пс 2покердом джокера мтт не бьются , переведите эти турниры обратно на прогрессивный ...
график сделаю и докажу это ...
-12500 руб 0 ноков...мда... Мэтэтэ
Прайм бразильский в мтт
Бразильцы повержены...
Новости ИИ
MiniMax M3 вышел
Топовый китаец
c00l0ne @ 01.06.26MiniMax M3 вышел
Закинул пару мощных идей в нее, зациклилась в писанине пусто головой...
Не ровня gpt-5.5 pro
20 минут уже:
Ерундой занимается
За это время gpt-5.5 pro + codex реализовали почти идею...
Китайцы опять бенчмарки хакнули... Мда
Идеи касательно cfr
Как оказалось ГТО стратегий множество есть и солвер приходит к одной из ... А в целом есть семейство решений спота в котором эксплуатируемость нулевая ...а например в gto wizard или ПивоСолвере мы видим одно решение из этого семейства... Поэтому в разных солверах мы можем получать отличные решения гтошные, но они будут обладать все эксплуатируемостью заданной...
Без весов стратегия сильно ломается ... Но чтобы это доказать нужно решить mip-солвером(а это будет стоить сотни миллионов долларов, если вообще получится при текущем уровне вычислений )... ГТО cfr :Только боты могут повторить такую стратегию... Люди играющие без рандомайзера сильно эксплуатируемы той же гтошкой (10+bb/100) ... Можно посчитать такую стратегию ГТО которая будет мало эксплуатируемой но стремиться эксплуатировать определенную стратегию оппонента(дополнительные +bb ev)...
Короче поле не паханное... Накидываю в codex идею за идеей, кодовая база растет...
Что сейчас доступно, это считать эксплойты по майнинг базам, но если в такую поляну врывается ГТО бот))) то поляне пздц... Потому что одни равновесие отклоняют в одну сторону, а другие эксплойтят отклоняясь в другую сторону, а гтошка собирает с обоих сторон ...
Основная проблема в холдем это задать стратегию оппонента, для этого бакеты приходится применять... Ну и от качества бакетинга зависит получаемая эксплойт стратегия... В целом же идёт гонка бакетинга...кто лучше и точнее разделит стратегии оппонентов, тот лучше посчитает эксплойт...
В целом оценю так:
Китайский покер решается на 90% в наше время, можно даже до 95% , а можно и 99%, но это уже дорогие сервера...
А холдем решен процентов на 65%... Я про эксплойт мало эксплуатируемый... Гтошка процентов на 90-95...
Омаха ещё меньше...
Вывод какой: основные деньги в Омахе)
(Только солвера нет)
В китайский солвер точнее всего на данный момент, а холдем и Омаха только будут в будущем развиваться...только не могу понять что для этого нужно ... Наверное нужен быстрый mip солвер, математика должна шагнуть далеко вперёд в комбинаторике , чтобы научиться быстро решать гигантские задачи по холдему
Вот ещё репост интересного, как солвер влияет на игру на примере Go
c00l0ne, забавно как у тебя идут полотна текста за которые не получается зацепиться, а потом хуяк! и что-то реально крутое. Или может я просто никогда ничего не понимал )))
c00l0ne @ 01.06.26Идеи касательно cfr
Как оказалось ГТО стратегий множество есть и солвер приходит к одной из ... А в целом есть семейство решений спота в котором эксплуатируемость нулевая ...а например в gto wizard или ПивоСолвере мы видим одно решение из этого семейства... Поэтому в разных солверах мы можем получать отличные решения гтошные, но они будут обладать все эксплуатируемостью заданной...
О да, в математике оно называется "область Парето". можешь кинуть AI термин, оно подтянет какой-то математический контекст. В теории игр оно ровно так - у тебя может быть больше одной точки где срабатывает равновесие. И типа нельзя поменять какой-то один параметр не ухудшив какой-то другой. Но для меня это до сих пор загадка как это работает в покере. У нас для холдема много солверов, но они почему-то выдают одно и то же решение с точностью до погрешности если исходное дерево и абстракции одинаковые. Читаю дальше что ты нароешь :)
у меня была идея альтернативно считать солверные равновесия. Не используя CFR. Есть и другие альтернативные способы построить "солвер". Например популярный подход использовать reinforecemnt learning. Т.е. ты играешь каким-то агентом против самого себя, штрафуешь за проигрыши, поощряешь за выигрыши. Требует нехуёвых вычислительных ресурсов, зато не так много памяти (по сравнению с CFR). Имеет свои плюсы\минусы. Требует костылей для выхода из локальных экстремумов.
ещё можно сравнивать разные решения в "песочнице" заставляя играть против друг друга. Не все реальные эксплуатирующие решения удастся сравнить в солвере. Могу привести пример - если скажем ты считаешь какое-то решение в любой точке, то ты никак не учитываешь там карты hero на руке (считается что это не нужно). а по факту это блокеры ранаутов борда. Но если сделать честное решение (я как-то делал на jesolver), то сравнивать в лоб с обычным решением не получится без песочницы. Это было в эпоху до AI, и я так и не дописал для себя такую систему где бы сравнивал такие решения. С точки зрения заработка тогда было не актуально. думаю сейчас тоже. по крайней мере в холдеме. Но попробовать любопытно.
В целом оценю так:
Китайский покер решается на 90% в наше время, можно даже до 95% , а можно и 99%, но это уже дорогие сервера...
вот у меня есть пример людей, кто китайский именно порешали с помощью RL. Не сравнивал точность. вообще никогда не было времени на эту задачу.
Вывод какой: основные деньги в Омахе)
всё так. я б сказал что холдем вообще бесперспективен в плане игры против сильных игроков. для меня даже странно, что кто-то профессионально в него всё ещё лезет и что-то пробует новое. в PLO6 сейчас можно edge грести лопатой даже без солверов и наживать хорошие суммы даже при конском рейке.
математика должна шагнуть далеко вперёд в комбинаторике , чтобы научиться быстро решать гигантские задачи по холдему
всё что нужно было сделать в математике для этих решений сделано уже лет 50 назад. Просто математика это сложный орешек. Найти какую-то статью, где сделали ровно то что ты хочешь X лет назад это та ещё задача. Комбинаторика кстати активно развивающаяся наука. Но там тоже порог вхождения возрастает по экспоненте. То что используется в современном покере это детство. Считай уровень 2 курса среднего технического вуза. Может быть есть какой-то инструмент качественно прошерстить архив и другие популярные источники с публикациями? типа как-то зарядить AI агента на детект того, что в теории не понятно и поиск этого непонятного? я понимаю, что дохера хочу и этого скорее всего нет. Но я почти наверняка уверен, что когда ты найдёшь какую-то модель и скажешь "эврика" то окажется, что её уже описал какой-то аспирант в рамках своего кандидатского минимума лет 20-30 назад. Вот например как статья ранее про восстановление диапазонов по майнингу была давно. Но при этом про неё знают только в узкой прослойке специалистов, и никаких способов сгенерировать такое же с помощью AI нет, т.к. оно тупо не имеет этого в своей базе обучения.
SnowBeaver @ 01.06.26математике для этих решений сделано уже лет 50 назад
может оно и сделано но mip солвера или LP солвера стоят 20к баксов в мес(
эти солвера способны точно решить холдем...
вот там работают ведующие математики мира сего ...
SnowBeaver @ 01.06.26вот у меня есть пример людей, кто китайский именно порешали с помощью RL
я оцениваю в 90% точность такого решения +-0.2-0.3 куша
SnowBeaver @ 01.06.26холдем вообще бесперспективен в плане игры против сильных игроков
почему?)
вот я сегодня выиграл турнир по холдему, люди просто стулом сидят на финалке , как это было три четыре года назад ...
ничего не меняется...
SnowBeaver @ 01.06.26математике оно называется "область Парето".
поищу
у меня проблема основная gpt-5.5 pro лимиты очень быстро сжигаются ( прям очень быстро приходиться по три дня ждать когда восстановят (
а простая gpt-5.5 как то не сильно разбирается в теме и не глубоко ... а пинать ее со всех сторон надоедает ...
кому интересно поковыряться с cfr https://github.com/exinori/DCFR-SOLVER вот тут оч сильная работа с CFR, но сам движок slow откровенно медленный
а вот тут пушка бомба ракета
c00l0ne @ 01.06.26вот я сегодня выиграл турнир по холдему, люди просто стулом сидят на финалке , как это было три четыре года назад ...
ничего не меняется...
вопрос лимита. если играется какой-то где сидят профессионалы, то они задают потолок. и в холдеме он низкий. Я думаю уже на 50$ лимите даже близко нет лёгких денег на финалках (может и ещё раньше). На мой взгляд бесперспективно тратить время на обучение холдему если хочешь продолжать зарабатывать покером. Да, бывает тяжко менять радикально дисциплину, но таков путь. Это не значит, что выигрывать в холдем больше нельзя. Просто если честно относиться к анализу $/h, то холдем не выглядит перспективно.
SnowBeaver, вот ты пишешь на форуме где 90 процентов или 95 процентов играют в холдем) забавно читать такое... Хз в любой игре есть тонкости, которые ты освоив имеешь какой то Эдж, чем больше механик и тонкостей освоил, тем больше Профит
Есть базовый уровень рега, который уже делает больше чем Фиши и зарабатывает
c00l0ne, сейчас Омаха это мейнстрим. Я не думаю, что 90% людей на форуме кто покером себе обеспечивает достойную жизнь играет сейчас в холдем. Но врядли мы честную статистику соберём даже если захотим.
c00l0ne @ 30.05.26открытую oss 120b
пилотно запустил на oss 20b
может кто еще энтузиаст вот пайплайн :
1. берем эту модельку и генерируем сотни решений задачи , просто один и тот же запрос сотни раз с температурой ну 0.5-1
(если по умному то нейронка отдаст статическое распределение внутри сохраненное)
2. далее берем все эти результаты и обрабатываем чем-то огромным : у меня minimax m3 , просто смотрит результат , в моем случае код и делает ревью , где ошибки где хорошо где плохо описывает все подробно
3. составляем из всего проделанного датасет для LoRA , берем лучшие результаты у меня в видеокарту влазит 20 всего примеров)
берем топ20 (тут еще неплохо добавить весов хорошим примерам и занизить веса неудачных)
4. запускаем LoRA дообучение, делаем адаптер к нейросети
5. возвращаемся к пункту 1 , но уже подключив этот адаптер и еще мелочь но важно дополняем промпт
т.е. у меня две фазы сразу в одной: ПРОМПТ + весовой апдейт
зацикливаем до получения хорошего результата ...
пока я только 1-2 раза крутил ... времени нету , на один прогон нужно где-то часа 3-4-5 а на цикл из 100 это дней десять ...
на 3090 oss 20b с ризонингом(кто знает это чудо тот знает)
куда это все идет: к каким то самообучающимся машинам)
после доезда в мтт можно не садиться играть, фиши просто выдают базу :
невероятные доезды , повторы , бам бам бам -30к руб ...
тяжело ...
но покердом радует оверлей сегодня залетел +15к руб ...
испортили всю сетку мтт в китайский своими джокерами ...
теперь пожинают плоды...
да понял я идею :) ну как я думаю. она так то для меня не новая. Я тебе даже больше скажу, я это делал и доводил до результата. Года 4 назад так развлекался. Это вообще первое что всем приходит в голову когда они хотят смоделировать поле. На практике это менее полезно, чем модели, которые могут без опоры на ГТО сойтись с хорошей точностью. Значительная часть линий постфлоп от ГТО дальше чем от рандомного распределения, и ГТО мешает обучаться модели, а не помогает если ты на этих данных предобучил модель (любую). Но если у тебя получится вычислительный эксперимент, который покажет обратное, то я буду апплодировать стоя. Но этого скорее не случится :)
а то что даже топовые игроки эксплуатируемы это факт. другой момент что обучить этому эксплойту непросто. Отдельная нехеровая задача. Если конечно ты не бот.