arXiv cs.AI / cs.LG / cs.CL·2d agoMinimally Invasive Steering of Language Models#language-models#steering#misvoAI research
Hacker News · security·5d agoShopify CEO says employees' 'slop grenades' are making more work for everyone#ai-industry#ai-productivity#code-generation 2 min
The Decoder·7d agoGoogle Deepmind's Dream-RSI helps AI agents improve by “dreaming” about past attempts#ai-agents#code-generation#dream-rsi 5 min1
Hugging Face daily papers·9d agoCodeMidas: Scaling Agentic Coding RL Environments from Code Itself#code-generation#codemidas#coding-agents2
arXiv cs.AI / cs.LG / cs.CL·9d agoAdaRepair-Mem: Adaptive Experience Orchestration for Repository-Level Program Repair#code-generation#llm-agents#memory-retrievalAI research
arXiv cs.CR·10d agoMAGS: Multi-agent Auto-formalization Guarantees Safety for Agentic Outputs#code-generation#coding-agents#dafnyAI research1
arXiv cs.CR·10d agoA Security Risk Assessment Framework for AI-Powered Development Tools#ai-generated-code#bandit#code-generationAI safety & security1
OpenAI News·15d agoPerplexity trusts GPT-6 Astra with end-to-end systems#api#automated-testing#code-generation1
arXiv cs.AI / cs.LG / cs.CL·17d agoRetrofitting Code Using LLMs to Support Exceptional Behavior#code-generation#exception-handling#javaAI research2
arXiv cs.CR·18d agoCS-Guard: Benchmarking LLM Guardrails for Code Generation Security#benchmark#code-generation#cs-guardAI safety & security1
Hugging Face daily papers·18d agoΦ-Bench: Can Large Language Models Engineer the Infrastructure That Powers Them?#benchmark#code-generation#evaluation1
arXiv cs.AI / cs.LG / cs.CL·18d agoEntropy-Regularized Rank-Masked Policy Optimization for Test-Time Reinforcement Learning in Code Generation#arxiv#code-generation#entropy-regularizationAI research1
Hugging Face daily papers·22d agoDiffs vs. Whole Files: An Empirical Comparison of Iterative Edit-Based and Direct Generation for Flutter/Dart Code Models#code-editing#code-generation#dart1
Hugging Face daily papers·24d agoWhat Else Needs Fixing? Exploring Cost-Effective Test-Time Compute for Revision Propagation in Artifacts Generated Through Conversation#artifact-revision#benchmark#code-generation