RT @cursor_ai: Cursor is now free for students. Enjoy!
会話
関連する投稿
- author @BD1pt0ZCnY
6/25/2026, 11:10:39 PM forkしたら解決した うーん? ターン管理がなんか微妙になる瞬間があるな
- author @BD1pt0ZCnY
6/11/2026, 7:44:26 AM 要点だけまとめると、**DiffusionGemma GGUFは普通のGGUFモデルとして扱うと詰まる**、というのが最大のポイントです。 **先に知るべきこと** DiffusionGemmaは通常のautoregressive LLMではなく、`diffusion-gemma` architectureのGGUFです。なので、普通の`llama-cli`、`llama-server`、LM Studio、Ollama、Unsloth Studioの通常推論経路では、モデルファイル自体が正しくても実行できないことがあります。 典型的なエラーはこれです。 ```text unknown model architecture: 'diffusion-gemma' llama.cpp does not support this GGUF's model architecture ('diffusion-gemma') ``` この場合、モデルが壊れているのではなく、runner側が未対応です。 **必要なrunner** 現状はDiffusionGemma対応入りの`llama.cpp` PR/ブランチを使い、通常の`llama-cli`ではなく、専用の: ```text llama-diffusion-cli ``` をビルドして使うのが本筋です。 **CUDAビルドの罠** GPUで使うならCUDAビルドが必要です。ただし古いCUDA Toolkitだと、最近のMSVCでビルドに失敗します。 典型例: ```text error STL1002: Unexpected compiler version, expected CUDA 12.4 or newer. ``` これはCUDAが古いという意味です。CUDA 12.4以上を使うのが安全です。 **低VRAMでの現実** 8GB VRAM級ではモデル全体は載りません。全部GPUに載せようとするより、部分オフロードが現実的です。 実用ラインはだいたい: ```text -ngl 8 --diffusion-kv-cache on --diffusion-eb on ``` `-ngl auto`や`-ngl all`は一見便利ですが、低VRAM環境ではVRAM/RAMを攻めすぎて不安定になりがちです。手動で`-ngl`を固定した方が安全です。 **KV cacheはON** `--diffusion-kv-cache on`はかなり効きます。 OFFだと毎stepの負荷が重くなりやすいです。まずONで試すべきです。 **KV cache量子化は万能ではない** 通常LLM感覚で、 ```text -ctk q8_0 -ctv q8_0 -ctk q4_0 ``` などを入れたくなりますが、DiffusionGemmaでは必ず速くなるとは限りません。特にV cache量子化はFlash Attention絡みで失敗・低速化する可能性があります。まずはデフォルトKV型でよいです。 **`-n`の意味が普通と違う** DiffusionGemmaでは`-n`は普通の「最大生成token数」として体感しにくいです。 内部では固定長canvasをブロック単位でdenoiseします。 今回のモデルでは: ```text canvas_length = 256 -n 1 -> 1ブロック -n 512 -> 2ブロック -n 1024 -> 4ブロック ``` 短い回答なら`-n 1`で十分。 献立や計画のような長めの回答は`-n 512`が必要です。 **step数と品質** `--diffusion-eb-max-steps`が実用上かなり重要です。 ```text 16 steps: 速いが崩れやすい 32 steps: 遅いがだいぶ読める ``` `--diffusion-steps`だけ下げても、EB modeでは`--diffusion-eb-max-steps`側が効いている場合があります。両方揃えるのが分かりやすいです。 ```text --diffusion-eb-max-steps 32 --diffusion-steps 32 ``` **visual modeが面白い** DiffusionGemmaを試す価値は、普通のtoken streamingではなく、canvasがstepごとに更新されるところです。 ```text --diffusion-visual --diffusion-visual-progress --diffusion-visual-interval 1 ``` を付けると、途中で文が崩れたり整ったりする過程が見えます。 **日本語プロンプトの罠** Windowsでは日本語を`-p`で直接渡すと文字化けすることがあります。 UTF-8のプロンプトファイルを作って: ```text -f prompt.txt ``` で渡すのが安全です。 **thinking/channel問題** モデルやテンプレート次第で、出力にこういうものが混ざります。 ```text <|channel>thought ... <channel|> ``` これはチャットテンプレート/モデル形式/runner未成熟の問題です。 可能ならテンプレートに`enable_thinking=false`を渡す、または表示側で`<channel|>`以降だけ抜くと扱いやすくなります。 ただし、観察目的なら全部見えていた方が面白いです。 **反復検出の罠** runner側が反復を見つけて出力を切ることがあります。 ```text しししし 多多多多 ******** ``` みたいな崩れを止める目的ですが、DiffusionGemmaではこれが暴発して、`-n 512`で2ブロック生成するはずが1ブロックで止まることがあります。 理想は: ```text EOG tokenなら終了 反復は表示上trimしてもよい でも反復だけで次ブロック生成を止めない ``` です。 **おすすめ初期設定** まず試すならこれです。 ```powershell llama-diffusion-cli ` -m model.gguf ` -f prompt.txt ` -dev CUDA0 ` -ngl 8 ` -n 512 ` --fit off ` --diffusion-eb on ` --diffusion-kv-cache on ` --diffusion-eb-max-steps 32 ` --diffusion-steps 32 ` --diffusion-visual ` --diffusion-visual-progress ` --diffusion-visual-interval 1 ``` 短文なら: ```text -n 1 --diffusion-eb-max-steps 16 ``` 長めなら: ```text -n 512 --diffusion-eb-max-steps 32 ``` **最終評価** 低VRAM環境では、DiffusionGemmaはまだ普通のLLMより実用的とは言いにくいです。 ただし、5 canvas-token/s相当くらいは出ることがあり、visual mode込みの「面白枠」「研究枠」「将来比較用」としてはかなり価値があります。 一発でやるなら、最初からこう考えるのが近道です。 ```text 普通のGGUF runnerではなく専用diffusion runnerが必要 CUDA 12.4以上でビルド -nglは手動固定 KV cacheはON -nはcanvasブロック数 品質はEB stepsで調整 日本語はUTF-8ファイル visual modeで観察 反復停止は信用しすぎない ```
- author @BD1pt0ZCnY
5/26/2026, 11:08:08 PM 今現在だと、無料でそれなりのLLMのAPIを叩きたい場合: Opencode ZenでDeepseek-V4-Flash-free さくらのAI EngineでKimi-K2.6 Gemini APIでGemma-4-31B (OR 26B-A4B) あたり? あと試していないけどOpenrouter? Tier上げのための課金を許容できるならOpenAIのデータ共有でもらえるやつとかもありかも
- author @BD1pt0ZCnY
3/24/2026, 8:34:47 PM 備忘録: トランプ大統領が主張する電話会談などが他国政府などに否定された例 2025/3月 「日本の指導者に電話した」 ↓ 石破: 電話していない ロイター通信 トランプ米大統領から電話受けてない=通貨政策巡り石破首相 2025年3月4日午後 1:21 GMT+92025年3月4日更新 https://jp.reuters.com/opinion/forex-forum/BHDGGFMNINIC3MSXA52XOBOYIM-2025-03-04/ 4月 「習近平から電話があった」 ↓ 中国外務省: 直近に電話会談は行われていない ロイター通信 中国外務省、米中首脳の電話会談否定 「関税交渉せず」 2025年4月28日午後 6:50 GMT+92025年4月28日更新 https://jp.reuters.com/business/RZXVGNKLOVLNNEL4NISJDFLNFM-2025-04-28/ 6月 「昨日プーチンと電話した」 ↓ 露大統領府: 数日前の会談と勘違いしているのでは 「これに対しロシア大統領府(クレムリン)のドミトリー・ペスコフ報道官は、トランプ氏が主張した電話会談の日時に異議を唱えた。」 AFP トランプ氏、プーチン氏の仲裁申し出を拒絶「他国の心配してる場合じゃないだろう」 2025年6月19日 8:32 https://www.afpbb.com/articles/-/3584162 10月 「モディと電話した」 ↓ 印外務省: 会話があったとは把握していない 「しかし、16日にこの電話について質問されたインド政府の報道官は、トランプ氏の説明に疑問を呈し、「両首脳の間で15日に会話があったとは把握していない」と述べた。インド政府はこれに先立ち、ロシア産原油の購入に関してアメリカとの協議が「継続中」だと説明していた。」 BBC 2025年10月17日 インド、トランプ氏の主張に疑問呈す モディ氏がロシア産石油の購入停止に同意との電話は「把握せず」 https://www.bbc.com/japanese/articles/cp85x57xgkyo 2026/3月 「元米大統領に称賛された」 ↓ 存命の元米大統領が全員否定 「歴代大統領のうち存命は、ビル・クリントン、ジョージ・W・ブッシュ、バラク・オバマ、ジョー・バイデンの4氏。 クリントン氏の広報はCNNの取材に対し、イランについてもそれ以外の話題についても、クリントン氏とトランプ氏が最近会話を交わした事実はないと述べた。 同様にブッシュ、オバマ、バイデンの3氏の側近も16日、トランプ大統領と一切の連絡を取った記録はないと話している。」 CNN 2026年3月17日 トランプ大統領、イランめぐり「前任者に称賛された」 前任の4人は全員否定 https://www.cnn.co.jp/usa/35245116.html
- author @BD1pt0ZCnY
3/24/2026, 3:30:58 PM しばらく考えていたんだけど、CodexにはUXの観点が著しく欠如していて、それを教え込むためにSKILLなり、あるいはReasoning effortをあえて下げることで解決するらしいんだけど、これはやっぱり何かトレードオフがあるってことなんすかね 賢い官僚がアホみたいなポンチ絵を作るみたいな感じで