>Я больше про то, что разница не то чтобы прямо радикальная.
я про то же, но когда у тебя кончается память у тебя кончается память
>Там же вроде шина памяти узкое место а не вычислительная способность этого самого cpu.
если есть AVX2. если DDR3 - то просто AVX. я так понял. а если AVX нет, то упираешься в проц и неслабо. а есть этот AVX далеко не во всём, что можно добыть задешево. и он прям критичен. хотя... это со слов того же gemini, который допустил много других ошибок. но здесь всё звучит внутренне непротиворечиво. впрочем, будет ещё возможность померять. у меня как раз валяется тут старый больной proliant gen6 и avx у него, увы, нет и проапгрейдить нельзя.
а проблема паскалей в том что да, векторные операции для них нативны, но при деквантовании начинаются проблемы другого рода. реально большие модели принято квантовать по дефолту, т.к. они, в силу самого масштаба, от кванта почему-то не лоботомируются, в отличие от мелких, но старые ядра не умеют оперировать квантованными значениям нативно и перегоняют 4битное число в 32битное, производят операцию и перегоняют обратно. а ядро паскаль и без того старое и немощное. хотя, с другой стороны, узкое место всё равно память, вроде бы, поскольку память там, кажется, ещё медленнее.
ну, по крайней мере я так понял. кто понял лучше - я бы послушал
то есть всё это медленно, но пользоваться можно. а вот можно ли пользоваться чем-то запущенным на проце без AVX вообще - вот этого я пока просто не проверял
в orange pi 5 avx как такового нет, но там свой эквивалент векторной числодробилки, которая реально хороша в свои деньги. как я понял, mac mini убедительно тащат локальные модели по той же причине, хотя arm в них, конечно, другой
>Да просто одинаковые сетки пустить и инстансы агентов на них поподвязывать
ну это я как бы понимаю, но как заинтерфейсить их с задачей и анально при этом огородить, что бы они не захватили планету или, по меньшей мере, мою файлопомоечку
>Зачем ты вообще на него вяжешься, когда 3.6 не сильно глупее не смотря на меньший размер?
а как ты это понял? по метрикам из релиза? а ты заметил, что в метриках из релиза они всегда и все умнее абсолютно всех? чудеса бывают, но редко. а вообще у меня 3.5 больше как бэнчмарк пока, я кластер отлаживю, так-то нужен hermes, полагаю, а в модели маленького размера я не верю. то есть своя ниша у них есть, конечно, но они с больше вероятностью доставят проблемы, чем сделают что-то полезное на практике. это греп на стероидах - да, полезен, но оставлять его надолго без присмотра может и не сильно опасно, но и не сильно полезно
>Это же вполне лезет в контекст того же квена целиком, без всяких rag
ну не хватало ещё что бы он сожрал 100500 баксов, вместо 50. это был просто тест концепции на работоспособность, а суть в том, что этот подход масштабируется на текст вообще любого объема, тогда как контекст мало того что не резиновый, так ещё и не очень-то хорошо видит семантические связи. то есть само наличие какого-то словосочетания в глубине контекста он не потеряет, но семантическую связь между сущностями он не вспомнит пока ты не переместишь эту часть контекста в конец этого самого конекста(или в начало), что полностью инвалидирует кэш и для дальнейшего разбора потребует большое количество таких итераций. так вот в graphrag это буквально сделано заранее и закэшировано. за то и деньги взяты. и на голом контексте это работать не будет, нужна какая-то итеративность по тексту и grahrag, как я понял, это что-то типа закэшированной итеративности, причем она ещё в и виде векторов лежит, кажется. надо дальше разбираться. но это мастхэв.
и кроме того - да, контекст сам по себе вещь глубоко не бесплатная. размер контекста можно выбирать при запуске и большой контекст начинает жрать сильно много памяти. в моём бэнчмарке контекст 256k, но это больше ради самого бэнчмарка. на самом деле, при заливке такого контекста она начинает неистово жрать розетку и греться. 2кВт. и это долго! лучше разбивать задачу, там где это возможно. просто по экономическим соображениям. контекст дорогой и семантические связи в его середине неустойчивы, такие вот вещи я постиг
>opencode
этого не пробовал. пробовал openclaw и aider, сейчас думаю что пробовать дальше
open interpreter интересный, но я понимаю что мне нужно несколько агентов
smolagent даже интереснее, там агент - это питоновский объект, но мне пока другое нужно, мне важнее что бы он нативно контактировал с системными тулзами