• Dün, 23:20:40
    #1
    Arkadaşlar merhabalar,
    Aranızda daha önce belirli görevleri yerine getirmek üzere local (yerel) çalışan yapay zekâ agent geliştiren oldu mu?
    Özellikle Ollama, Llama, Qwen vb. local LLM’ler kullanarak; veri okuyabilen, analiz yapabilen, gerektiğinde SQL sorguları çalıştırabilen veya farklı sistemlerle etkileşime girebilen agent yapılarıyla ilgileniyorum.
    Bu konuda deneyimi olan arkadaşlar;
    • Hangi model ve teknolojileri kullandınız?
    • Agent mimarinizi nasıl kurguladınız?
    • Tool/function calling tarafında nasıl bir yapı kullandınız?
    • Performans ve model doğruluğu konusunda ne gibi problemler yaşadınız?
    • Local çalışmanın avantajları/dezavantajları neler oldu?
    Tecrübelerinizi ve mümkünse kullandığınız teknolojileri paylaşabilirseniz çok faydalı olur.
    Şimdiden teşekkürler.
  • Dün, 23:22:36
    #2
    • Local çalışmanın avantajları/dezavantajları neler oldu?
    localde model çalıştırmak çok pahalı donanım maliyeti olarak söylüyorum bu işin en ucuz yolu api kullanmakta değil cli üzerinden çalışa bilen uygulamalar üretmek birden çok agent ile bir yönetim kurmak ve çalıştırmak

    ufak modeller bir işe yaramaz doğru düzgün sohbet edersin anca
  • Dün, 23:41:39
    #3
    Çok kapsamlı bir harness dahi kursan şuanda ciddi bir sistemin yoksa çalıştırabileceğin 70-80 milyar parametreli modellerde dahi vaow olamayacaksın. Amiral gemisi modeller dahi halisünasyon sebepleriyle tonlarca hata yapıyorken yerel model ne halde düşün güncel qwen 3.8 kullanıyorum ama kesinlikle claude ile entegre şekilde yoksa hata kaçınılmaz sadece çok basit ve tekrarlı işleri yapabilecek kapasite var sanıyorum.
  • Bugün, 00:33:10
    #4
    @slymntgyn;
    localde pro mantığında kullanabileceğin GPU , A6000 Blackwell. onunda ram'i 96GB. Kullanabileceğin model genel olarak 70B modeller. 70B'nin her serisi değil.
    Ayrıca o GPU için 9950x bile yeterli performansı sağlayamıyor. L3 de sorunlar yaşanır. Tercihen Epik/Xeon işlemciler gerekli.

    Localde AI Asistan projesi için ve hala da Ollama çalışıyor bilgisayarımda. (devam etmedim). 3k context benim gpu yapım için ideal. Mutlaka Tuning yapman ve uzun senaryolar ile kontrol etmen gerek.
    Youtube da bugün bile çok seyredilen birisi paylaşım yapmış.
    Maalesef o videolara inanmayın.
    Çalışmaz demiyorum. İstediğiniz sn deki token limitini alamayacağınız gibi, uzmanlık konusunda biraz yavan kalacak.
    Ülkemiz için 5070Ti ile kullanabileceğiniz bir llm modeli yatırım bedeline online bir modelin Pro serisini kullanarak karlı bir proje üretebilirsiniz. Ve kazancınız ile de bu süreç devam eder. Ne zamana kadar ? RAM - GPU ve LLM mimarisinde yeni teknoloji geliştirilene kadar. Mevcut LLM modelleri CUDA ile geliştirildiği için maalesef orada bir çıkmaz var.

    AMD Halo serisi işlemciler ile çok güzel planlar yapsa bile, Datacenter kar oranları çok iyi olması sebebi ile son kullanıcı dediğimiz gruba çalışmaları yavaş kalıyor. Madusa Halo 595 için teorik tanımları oldukça iyi olsa bile şuan piyasada sanırım 475 var.

    Çok övülen Qwen 27B modeli de belirli yere kadar uzmanlığı var. bit sayısına göre de genelde 24GB GPU ister. Ram olarak da 48 den aşağı olmaması işlemcide de 12 tekil çekirdek , Gen5 anakart mantıklı olur.

    Proje geliştirirken bir modele de sadık kalmayın. Birçok arkadaşımız model değiştirdiklerinden ve farklı kullanım senaryoları anlatıyor. Hepsinde ortak konu ise, bir yerde mutlaka llm in eşrek saati mutlaka çıkıyor.
    Claude'un bana bir yorumu var.
    Tek bir llm ile kodlama yaptın. Analizi mutlaka farklı llm modeline yaptır. Revizyonun değerlendirmesini başkasına yaptır.

    Birçok arkadaşımız kodlama ile analizi aynı chat içinde yaptırıyor. Ve ardışık yaptırıyor. Mevcut context bağında eski ezberleri duruyor ve server cache'de aynı sorgular var.
    Şahsen Opencode gibi limitli de olsa çoklu llm modeli destekleyen bir API herkese lazım. Uzun soluklu projeler için Opencode Zen limitleri de mantıklı değil. Kullandığım için biliyorum. Ama bu tür bir agent el altında olması faydalı olur.

    Ben daha çok DeepSeek Flash kullanıyorum. Peak saatlerinde kullanmıyorum. Dolayısı ile birim maliyet düşüyor. Benzer işi yapabilirsen GLM içinde yapabilirsiniz.
    Malum ençok GPT/Codex satışı yapan arkadaşımızdan sorgu sayısına göre limitler alabilirsiniz. Veya farklı modelleri günlük verenlerden de faydalana bilirsiniz. Yeterki tek modele sadık kalmayın.

    En önemlisi yapmak istediğiniz işin tüm basamaklarını bilmeniz gerek.
    Planlama - faz yapılarını oluşturmanız. bu konuda da tek llm e sabit kalmayın. Claude birçok konuda cidden güzel mimari hazırlıyor. Ama çoğunlukla da kendi hatalarını görmüyor. Onun sonuçlarını başkasına analizi sonucunda, yeni çözümleri mükemmel olabiliyor. Bunu tekrarlı şekilde yaptırmak gerekiyor.
    Server'larda cache bellek var. Birçok cevap oradan gelir. bazen de hatalı cevap gelebiliyor. Siz kendi kullandığınız agent da mutlaka context'i koparmayı unutmayın.
    Ve her agent için çok güzel pluginler var. Memory - GUI Test - SuperPowers gibi.

    Localdeki en iyi llm ile basit işler yaptırsanız - güzel sonuçlar alsanız bile, doğruluğu veya mükemmelliği soru işareti.
    Pluginler ile destekleyebilirsiniz. Skiller ile kolaylıkalr sağlayabilirsiniz. Başkalarının hazırladığı yapılardan faydalanabilirsiniz.

    Local LLM için en ideal yapı AI Asistan projesinde kısa süreli basit destek amaçlıdır. Boş denecek bir LLM alıp, kendi eğitiminizi yaptırmak isterseniz deneyebilirsiniz. Uzun zaman önce google'ın serverlarında limitli özelliklerini denemiş idim. Bugün nasıl yapıldığını bile hatırlamıyorum.

    LLM ler ile bolca sohbet edin. Mutlaka önerdiklerini sorgulayın. Ve kendisine önerisinin risk analizini sorun. Bilmediğiniz - farkında olmadığınız bir teknoloji veya metodu önerdiğinde kısaca açıklamasını isteyip deperlendirmeyi siz yapın. Çok absürdük öneri sunabiliyorlar. Farklı online free modellerden aynı soruyu sorgulayın. Ve cevapları çaprazlayın.

    Başarılar